Viện Trí tuệ Nhân tạo Allen (Ai2) đã mã nguồn mở AstaBrief 8B vào ngày 2/10, một mô hình chuyên chuyển câu hỏi nghiên cứu và các đoạn tài liệu truy xuất được thành báo cáo khoa học có trích dẫn. Mô hình được tinh chỉnh từ Qwen3-8B của Alibaba, trọng số và dữ liệu huấn luyện đã được đăng lên Hugging Face, còn trên GitHub Ai2 cung cấp thêm một ví dụ về cách dựng quy trình báo cáo từ các file PDF riêng của người dùng.
AstaBrief hiện là nền tảng cho "chế độ Fast" trong Asta, nền tảng tác tử nghiên cứu của Ai2. Chế độ Thinking trước đây chạy trên Claude, trung bình mỗi báo cáo cần 178,5 giây; sau khi chuyển sang AstaBrief, thời gian trung bình giảm xuống 51,1 giây, nhanh hơn khoảng 3,5 lần. Ai2 giải thích động lực này trên blog của mình:
"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."
(Chúng tôi muốn giúp các nhà khoa học tạo báo cáo có trích dẫn nhanh hơn, bằng một mô hình mà họ có thể tự tải xuống và tự chạy.)
Không dùng học tăng cường, chỉ làm dữ liệu qua hai vòng
Quá trình huấn luyện gồm hai giai đoạn. Ở giai đoạn tinh chỉnh có giám sát, Ai2 lọc ra 90.000 câu hỏi thực tế từ người dùng Asta, dùng Claude 3.5/3.7 Sonnet, o3, o4-mini và GPT-4.1 để tạo câu trả lời mẫu, cuối cùng giữ lại khoảng 47.000 mẫu khả dụng.
Giai đoạn tối ưu hóa ưu tiên (DPO) dùng một bộ câu hỏi khác: một bên là báo cáo do quy trình ScholarQA chạy trên Claude viết ra, bên còn lại là các phiên bản từ o3, o4-mini, DeepSeek-V3 hoặc DeepSeek-R1, được hai "giám khảo" GPT-4.1 và DeepSeek-R1 so sánh; chỉ giữ lại khi hai giám khảo đồng thuận, cuối cùng còn khoảng 6.000 mẫu. Ai2 cho biết tỷ lệ đồng thuận giữa hai giám khảo này với đánh giá của con người là 95%.
Nhóm nghiên cứu không dùng học tăng cường vì cho rằng nó không ổn định và tốn kém. Quy trình cũng được đơn giản hóa: toàn bộ báo cáo được viết một lần, không còn tạo theo từng phần, qua đó bỏ được hai khâu tốn tài nguyên tính toán là tóm tắt đoạn và phân cụm.
Trong số các cách lọc dữ liệu, cách hiệu quả nhất lại rất đơn giản: loại bỏ các mẫu tổng hợp có mật độ trích dẫn thấp. Ai2 kết luận rằng tín hiệu trực tiếp như "đầu ra có căn cứ hay không" hữu ích hơn các bộ lọc phức tạp nhiều tầng.
So với các quy trình mã nguồn đóng
Bài đánh giá chính dùng SQABench-CS2, gồm 200 câu hỏi khoa học máy tính, xem xét bốn khía cạnh: độ phủ nội dung, mức liên quan của đoạn văn, trích dẫn có hỗ trợ được luận điểm hay không, và luận điểm có đều được trích dẫn hay không. Trong các so sánh dùng mô hình lớn làm giám khảo, AstaBrief, quy trình chạy trên Claude và DR Tulu — mô hình nghiên cứu mã nguồn mở trước đó của Ai2 — mỗi bên đều có lúc thắng lúc thua.
Đánh giá của con người có quy mô nhỏ: 3 nhà nghiên cứu, mỗi người xem 14 đến 15 câu hỏi, trong đó hai người xếp độ chính xác trích dẫn của AstaBrief ở vị trí số một. Một benchmark khác, DeepScholarBench, lấy từ các bài báo arXiv gần đây, gồm 63 câu hỏi.
Dữ liệu thực tế đến từ 374 người dùng Asta: 29,1% dùng chế độ Fast trong hơn hai ngày, trung bình mỗi người tạo 3,67 cuộc báo cáo; 23% sau đó chỉ dùng Fast, 18% chuyển đổi qua lại giữa hai chế độ.
Trong số các công cụ cùng loại, chức năng deep research của OpenAI và Google đều chạy trên các mô hình lớn mã nguồn đóng, người dùng không có được trọng số và cũng không thể đưa quy trình vào thư viện tài liệu riêng của mình. Lựa chọn của AstaBrief là thu nhỏ quy mô xuống 8B để đổi lấy khả năng tải xuống và tùy biến. Theo ước tính thô, trọng số ở độ chính xác bán phần (half precision) nặng khoảng 16GB, một card đồ họa 24GB VRAM là có thể nạp được, giúp giảm đáng kể rào cản để các phòng lab đại học sử dụng. Mô hình nền là Qwen3, nhưng các câu hỏi dùng để huấn luyện chủ yếu là khoa học máy tính bằng tiếng Anh, còn hiệu quả khi xử lý tài liệu tiếng Trung thì Ai2 chưa đưa ra số liệu.
Các đánh giá chỉ tính đến năm 2025
Ai2 tự nêu rõ giới hạn: các bài đánh giá này được thực hiện trong năm 2025, đối chiếu với các mô hình hàng đầu ở thời điểm đó, chưa chạy lại với các mô hình hiện nay. Vì vậy, kết quả "ngang ngửa với quy trình chạy trên Claude" ứng với thế hệ Claude 3.7, còn hiện tại Anthropic đã ra tới Opus 5.5.
Ai2 còn chỉ ra một điểm yếu mà các chỉ số trích dẫn không bắt được: mô hình có thể trích dẫn đúng tài liệu nhưng lại diễn đạt quá chắc chắn so với nguyên văn, chẳng hạn biến phát hiện trong một mẫu cụ thể thành quy luật chung, hoặc biến kết quả mang tính mô tả thành khuyến nghị hành động. Bốn chỉ số hiện tại không đo được kiểu sai lệch này, Ai2 cho biết bước tiếp theo sẽ đo riêng khả năng mô hình giữ đúng phạm vi và mức độ chắc chắn của luận điểm gốc.
Nguồn tham khảo: blog chính thức của Ai2, CocoLoop; thời gian tạo báo cáo, quy mô mẫu huấn luyện và tỷ lệ sử dụng của người dùng theo số liệu Ai2 công bố, nhu cầu VRAM là ước tính của biên tập viên.