Mistral vừa phát hành Agentic Search, chuyển việc truy hồi tài liệu từ một lần lấy về sang thao tác nhiều bước. Hệ thống cấp cho mô hình năm công cụ: search, open, navigate, read, grep. Mô hình có thể tìm một vòng, mở file trúng ra xem, lật đến một mục cụ thể, đọc xong thấy sai thì đổi từ khóa tìm lại, xác nhận ổn rồi mới trả lời.
Cách làm này tạo ra mức cải thiện không nhỏ trên hai bộ đánh giá. FinanceBench dùng hồ sơ SEC của các công ty niêm yết tại Mỹ, độ chính xác tăng từ 26,7% lên 86%, gấp hơn ba lần. OfficeQA Pro dùng các công báo của Bộ Tài chính Mỹ để ra đề, tăng từ 6,3% lên 51,9%, tức tăng thêm 45,6 điểm phần trăm.
Truy hồi một lần vướng ở đâu
Quy trình RAG chuẩn là cắt tài liệu thành từng đoạn nhỏ, tính vector, truy hồi vài đoạn giống câu hỏi nhất, ghép vào ngữ cảnh để mô hình trả lời. Quy trình này đủ dùng cho câu hỏi kiểu “doanh thu năm nào đó của công ty là bao nhiêu”, nhưng bắt đầu bó tay với câu như “liệt kê dòng tiền tự do ba năm gần nhất và giải thích thay đổi trong cách tính”.
Chỗ hỏng nằm ngay từ bước cắt đoạn. Một con số trong báo cáo tài chính thường phải dựa vào ba thứ mới đọc đúng: giá trị trong bảng, chú thích dưới bảng, và phần diễn giải chuẩn mực kế toán ở một mục trước đó. Ba thứ này rất có thể nằm cách nhau vài chục trang, còn truy hồi vector xếp hạng theo độ giống ngữ nghĩa, nên chú thích và phần diễn giải chuẩn mực thường không lọt vào top đầu. Mô hình nhận được một con số trơ trọi, chỉ có thể đọc nguyên văn, đọc sai cũng không biết.
Truy hồi nhiều bước tái hiện lại cách con người lật tài liệu. Định vị trước, rồi mở rộng ra, gặp câu “xem chi tiết ở Phụ lục 12” thì nhảy sang xem, xem xong quay lại. Sự tồn tại của công cụ grep đặc biệt nói lên vấn đề: tìm kiếm vector giỏi khớp mờ theo ngữ nghĩa, nhưng gặp một chuỗi chính xác kiểu “Note 12” thì lại không đáng tin bằng khớp toàn văn kiểu cũ, hai cách truy hồi này mỗi cách phụ trách một phần trong cùng một bộ công cụ.
Ở đây còn có một lợi ích dễ bị bỏ qua. Câu trả lời từ truy hồi một lần không thể truy vết, mô hình nói doanh thu là một con số nào đó, người dùng muốn biết lấy từ trang nào thì chỉ có thể tự quay lại lật. Mỗi bước của truy hồi nhiều bước là một lệnh gọi công cụ tường minh, mở file nào, nhảy đến mục nào, khớp chuỗi nào, tất cả đều lưu lại trong dấu vết thao tác. Với các tình huống tài chính và pháp lý, bản thân chuỗi thao tác này đã là một phần của sản phẩm giao nộp, trả lời đúng còn phải chứng minh được vì sao đúng.
Chạy nhiều vòng hơn lại tiết kiệm hơn
Theo lẽ thường, thao tác nhiều bước sẽ kéo theo nhiều vòng hơn, tốn nhiều token hơn, chờ lâu hơn. Số liệu Mistral đưa ra lại ngược lại: lượng token dùng giảm tới 33,7%, độ trễ P90 giảm 39,6%, trên FinanceBench giảm từ 255 giây xuống còn 154 giây.
Con số này đúng với điều kiện là đối tượng so sánh. RAG một lần để bảo đảm độ phủ thường có xu hướng mở rộng số đoạn truy hồi, nhét hai mươi đến tám mươi đoạn vào ngữ cảnh, phần lớn trong đó không liên quan đến câu hỏi. Truy hồi nhiều bước mỗi vòng chỉ đọc đúng phần cần, số vòng tăng lên nhưng đầu vào mỗi vòng lại ngắn, tính tổng lại tiết kiệm hơn.
Khoản độ trễ phụ thuộc nhiều hơn vào cách triển khai kỹ thuật. P90 giảm cho thấy những trường hợp đuôi dài kiểu “truy hồi thất bại, mô hình bịa cứng, câu trả lời lệch lạc, phải chạy lại” đã ít đi. Thất bại của truy hồi một lần diễn ra âm thầm, mô hình không biết mình chưa lấy được chú thích; còn với truy hồi nhiều bước, mô hình có thể phát hiện ra mình chưa tìm thấy, thế là tìm lại một lần nữa, khiến phần đuôi dài được thu hẹp.
Hai cửa ải khi áp dụng vào tài liệu tiếng Trung
Cách Mistral cung cấp là Search Toolkit và Libraries, đã tích hợp vào Studio và Vibe, hỗ trợ triển khai trên đám mây lẫn tại chỗ. Điều kiện triển khai tại chỗ là yêu cầu bắt buộc với các ngành như tài chính, y tế, chính phủ vốn không được phép đưa tài liệu ra ngoài, và Mistral luôn xem đây là điểm khác biệt so với các hãng Mỹ.
Đưa cách làm này sang tài liệu tiếng Trung sẽ gặp hai vướng mắc mới. Một là grep không có ranh giới từ trong tiếng Trung, lợi ích của khớp chính xác nhỏ hơn nhiều so với tiếng Anh, tính sơ bộ thì nhiễu khớp trúng sẽ cao hơn hẳn; hai là bản cáo bạch, báo cáo thường niên, văn bản chính sách trong nước dùng rất nhiều bản scan và bảng biểu không chuẩn, bước read có khôi phục được cấu trúc bảng hay không sẽ quyết định trực tiếp các bước sau là đang đọc hay đang đoán mò.
Một điểm khác cần lưu ý là bản thân bộ đánh giá chuẩn. FinanceBench và OfficeQA Pro đều là bộ đề công khai, đề bài và tài liệu đã lan truyền trên mạng từ lâu, bất kỳ hãng nào đem hệ thống của mình đi làm điểm cũng có khả năng bị nhiễm dữ liệu huấn luyện. Mốc khởi điểm 26,7% thấp đến mức hơi bất thường, nó tương ứng với cấu hình RAG nào, số đoạn truy hồi mở đến đâu, dùng mô hình nền nào, thông cáo chính thức không nói rõ. Hướng cải thiện đáng tin, nhưng con số bội số thì nên chiết khấu bớt khi đọc.
Giá cả vẫn chưa công bố. Với các đơn vị doanh nghiệp mua sắm, khoản này rất quan trọng: mỗi câu hỏi đáp của truy hồi nhiều bước sẽ tạo ra nhiều lượt gọi mô hình, nếu tính phí theo lượt gọi thì để đổi lấy độ chính xác 86% sẽ phải trả gấp mấy lần đơn giá, bài toán chi phí phải tính lại từ đầu.
Nguồn tham khảo: thông cáo chính thức của Mistral, CocoLoop; các số liệu độ chính xác của FinanceBench và OfficeQA Pro, mức giảm token và độ trễ P90 đã được đối chiếu từng mục.