Tác nhân tìm kiếm mã nguồn mở Iris ra mắt: quản lý ngữ cảnh thắng số tham số

AllSpark Research vừa đưa trọng số của hai tác nhân tìm kiếm lên Hugging Face, đặt tên chung là Iris. Phiên bản nhỏ hơn, Iris-mini, được huấn luyện tiếp từ Qwen3.6-35B-A3B, tổng cộng 35 tỷ tham số, khi suy luận kích hoạt 3 tỷ; phiên bản lớn hơn, Iris-pro, có nền tảng là Qwen3.5-397B-A17B, tổng cộng 397 tỷ tham số, kích hoạt 17 tỷ. Cả hai đều dùng kiến trúc hỗn hợp chuyên gia (MoE), cửa sổ ngữ cảnh 256K, trọng số được công bố theo giấy phép Apache 2.0, báo cáo kỹ thuật đi kèm đăng trên arXiv ngày 3 tháng 9.

Khác biệt giữa tác nhân tìm kiếm và mô hình hội thoại thông thường nằm ở chỗ nó phải tự quyết định tìm gì, xem xong kết quả có tìm tiếp hay không, và khi nào bằng chứng đã đủ để dừng lại. Mảng này trong hai năm qua gần như do các sản phẩm mã nguồn đóng nắm giữ, phía mã nguồn mở có rất ít cái tên để đối chiếu.

Kết quả trên bốn bộ chuẩn

Bài báo đưa ra bốn bộ chuẩn: BrowseComp, BrowseComp-ZH, DeepSearchQA và HLE. Iris-mini đạt lần lượt 82,2, 84,8, 86,9, 52,3 điểm; Iris-pro đạt 88,6, 85,1, 92,9, 56,4 điểm, trong đó DeepSearchQA tính theo F1. Cả hai mô hình đều đạt thành tích tốt nhất trong hạng cân tham số của mình so với các tác nhân tìm kiếm mã nguồn mở khác, khoảng cách lớn nhất nằm ở BrowseComp.

Có một con số hơi trái trực giác: trên BrowseComp-ZH tiếng Trung, mô hình nhỏ 35 tỷ tham số đạt 84,8, mô hình lớn 397 tỷ tham số đạt 85,1, chỉ chênh 0,3 điểm. Cùng cặp mô hình này trên BrowseComp tiếng Anh lại chênh tới 6,4 điểm. Ở hạng mục tiếng Trung, quy mô tham số gần như không mang lại thêm gì.

Một phép so sánh khác trong bài báo cho thấy rõ hơn vấn đề nằm ở đâu. Nhóm nghiên cứu thử nghiệm ba chiến lược quản lý ngữ cảnh khi suy luận: không làm gì cả; “discard-all” (khi ngữ cảnh vượt ngưỡng thì xóa sạch lịch sử gọi công cụ đã tích lũy, bắt đầu lại từ câu hỏi gốc); và “retry” (tóm tắt các manh mối đã loại bỏ trước khi tiếp tục). Sau khi bật quản lý ngữ cảnh, cả hai mô hình đều tăng điểm, và Iris-mini tăng nhiều hơn Iris-pro. Nói cách khác, với mô hình nhỏ, việc kiểm soát lịch sử tìm kiếm ngày càng dài hiệu quả hơn là chỉ tăng tham số.

Dữ liệu huấn luyện được suy ngược từ các siêu liên kết

Câu hỏi tìm kiếm đa bước là khó tạo nhất. Viết tay một câu hỏi cần lướt qua ba bốn trang web mới trả lời được có chi phí quá cao, lại rất dễ bị mô hình lách qua bằng cách khớp chuỗi ký tự — nếu đề bài để lại một danh từ riêng nào đó, mô hình chỉ cần tìm kiếm là trúng ngay trang chứa đáp án.

Cách làm của Iris là đi ngược lại: chọn một trang hạt giống từ cấu trúc siêu liên kết của kho ngữ liệu web, lần theo các liên kết đi ra để chưng cất thành một đồ thị thực thể, sau đó biên soạn các chuỗi đa bước trên đồ thị đó, cuối cùng viết lại đề bài để đảm bảo không manh mối nào có thể giải được bằng khớp chữ.

Bản thân quá trình huấn luyện được bài báo gọi là “SFT-RL climbing”, luân phiên giữa tinh chỉnh có giám sát và học tăng cường. Giai đoạn học tăng cường chạy trên tìm kiếm thực, không phải ảnh chụp ngoại tuyến; mô hình phần thưởng dùng để chấm điểm và mô-đun tóm tắt kết quả quan sát đều được triển khai ngay trong cụm huấn luyện. Cấu hình này đồng nghĩa mỗi bước huấn luyện đều thực sự phát ra yêu cầu mạng, chi phí kỹ thuật không hề nhỏ.

Our policy is optimized by RL against live search.
(Chính sách của chúng tôi được tối ưu bằng học tăng cường dựa trên tìm kiếm thời gian thực.)

Phía mã nguồn mở cuối cùng cũng có đối thủ xứng tầm

Nhìn tổng thể, việc các mô hình mã nguồn mở đuổi kịp sản phẩm mã nguồn đóng ở mảng hội thoại chung và viết code đã gần như xong, tìm kiếm là mảng tụt hậu lâu nhất. Lý do không khó hiểu: năng lực của tác nhân tìm kiếm nằm một nửa ở mô hình, một nửa ở bộ khung điều phối công cụ bên ngoài; sản phẩm mã nguồn đóng tinh chỉnh cả hai cùng lúc, còn phía mã nguồn mở thường chỉ công bố mô hình mà không công bố khung.

Lần này Iris công bố cùng lúc trọng số mô hình, chiến lược quản lý ngữ cảnh và cách xây dựng dữ liệu, mã nguồn quy trình huấn luyện được ghi chú “sắp phát hành”. Kho GitHub ghi lời cảm ơn tới các dự án MiroThinker, Relax, ms-swift và slime, trong đó hai dự án đầu cũng là những nỗ lực mã nguồn mở về tác nhân tìm kiếm trong năm qua.

Báo cáo có đặt Iris cạnh các mô hình mã nguồn đóng như GPT-5.5 Pro, Gemini 3.1 Pro trong cùng một bảng BrowseComp để so sánh, nhưng phần nội dung chính của bài báo giới hạn cách diễn đạt “dẫn đầu cùng hạng cân” trong phạm vi mã nguồn mở, số liệu từng mục của các mô hình mã nguồn đóng không được trình bày chi tiết trong phần tóm tắt. Một điều khác cũng không được công khai là đơn vị chủ quản của nhóm AllSpark Research — các bài đưa tin công khai gắn nhóm này với một nền tảng nội dung của Trung Quốc, nhưng trang arXiv lẫn kho GitHub đều không ghi rõ đơn vị, trang cá nhân của cả chín tác giả cũng không có chú thích.

Với ai muốn tự chạy một hệ thống tìm kiếm sâu, quy cách 35 tỷ tham số, kích hoạt 3 tỷ là một lựa chọn vừa vặn, kết hợp với cơ chế quản lý ngữ cảnh trong bài báo thì một máy đơn cũng có thể chạy được. Phạm vi cấp phép Apache 2.0 cũng để đủ chỗ cho việc sử dụng thương mại.

Nguồn tham khảo: bài báo arXiv 2609.04304, kho AllSpark-Research/Iris, CocoLoop, trang mô hình Hugging Face; kết quả bốn bộ chuẩn và thông số tham số của hai phiên bản mô hình lấy theo bảng trong bài báo.