Allen Institute for AI (Ai2) merilis AstaBrief 8B sebagai open source pada 2 Oktober, sebuah model yang dirancang khusus untuk mengubah pertanyaan riset dan potongan literatur hasil pencarian menjadi laporan riset bersitasi. Model ini merupakan hasil fine-tuning dari Qwen3-8B milik Alibaba, dengan bobot dan data pelatihan yang sudah diunggah ke Hugging Face. Ai2 juga menyediakan contoh di GitHub tentang cara mengadaptasi pipeline ini menggunakan PDF milik pengguna sendiri.
AstaBrief kini menjadi model dasar untuk "mode Fast" di Asta, platform agen riset milik Ai2. Mode Thinking yang sebelumnya digerakkan oleh Claude membutuhkan rata-rata 178,5 detik per laporan; setelah beralih ke AstaBrief, waktunya turun menjadi rata-rata 51,1 detik, atau sekitar 3,5 kali lebih cepat. Ai2 menjelaskan alasannya di blog mereka:
"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."
(Mereka ingin membantu peneliti membuat laporan bersitasi lebih cepat, dengan model yang bisa mereka unduh dan jalankan sendiri.)
Tanpa reinforcement learning, cukup dua babak data
Pelatihan dilakukan dalam dua tahap. Pada tahap supervised fine-tuning, Ai2 menyaring 90.000 pertanyaan dari pengguna Asta yang sesungguhnya, lalu menggunakan Claude 3.5/3.7 Sonnet, o3, o4-mini, dan GPT-4.1 untuk menghasilkan jawaban target, hingga akhirnya tersisa sekitar 47.000 sampel yang bisa dipakai. Tahap preference optimization (DPO) menggunakan set pertanyaan yang berbeda: satu sisi berupa laporan dari pipeline ScholarQA berbasis Claude, sisi lain berupa versi dari o3, o4-mini, DeepSeek-V3, atau DeepSeek-R1. Dua model juri, GPT-4.1 dan DeepSeek-R1, membandingkan pasangan-pasangan ini, dan hanya pasangan yang disetujui kedua juri yang dipertahankan, menyisakan sekitar 6.000 pasangan. Ai2 menyebut tingkat kesepakatan kedua juri ini dengan penilaian manusia mencapai 95%.
Tim ini tidak menggunakan reinforcement learning dengan alasan tidak stabil dan mahal. Pipeline-nya pun disederhanakan: seluruh laporan ditulis sekali jalan, bukan per bagian, sehingga menghilangkan langkah peringkasan potongan teks dan clustering yang memakan banyak daya komputasi.
Dari beberapa metode penyaringan data yang dicoba, yang paling terasa efeknya justru yang paling sederhana: membuang sampel sintetis dengan densitas sitasi rendah. Kesimpulan Ai2, sinyal langsung soal "apakah output punya dasar" lebih efektif dibanding penyaringan berlapis yang rumit.
Dibandingkan dengan pipeline tertutup
Evaluasi utama menggunakan SQABench-CS2, 200 soal ilmu komputer, dinilai dari empat aspek: cakupan konten, relevansi paragraf, apakah sitasi mendukung klaim, dan apakah setiap klaim memiliki sitasi. Dalam perbandingan dengan model besar sebagai juri, AstaBrief silih berganti menang dan kalah melawan pipeline berbasis Claude maupun DR Tulu, model riset open source Ai2 sebelumnya. Evaluasi manusia dilakukan dalam skala kecil: tiga peneliti masing-masing menilai 14 hingga 15 soal, dan dua di antaranya menempatkan akurasi sitasi AstaBrief di posisi pertama. Benchmark kedua, DeepScholarBench, mengambil 63 soal dari paper arXiv terbaru.
Data pemakaian nyata berasal dari 374 pengguna Asta: 29,1% menggunakan mode Fast lebih dari dua hari, dengan rata-rata 3,67 percakapan laporan per orang; 23% kemudian hanya memakai mode Fast, dan 18% berpindah-pindah antara kedua mode.
Di antara alat sejenis, fitur deep research milik OpenAI dan Google sama-sama berjalan di atas model besar tertutup — pengguna tidak bisa mendapatkan bobotnya, apalagi memasukkan pipeline ke dalam pustaka literatur mereka sendiri. Trade-off AstaBrief adalah menyusutkan skala model ke 8B, dengan imbalan bisa diunduh dan dimodifikasi. Perkiraan kasarnya, bobot setengah presisi berukuran sekitar 16GB, cukup untuk dimuat di satu GPU dengan VRAM 24GB, sehingga ambang batas bagi laboratorium universitas untuk mengadopsinya turun cukup banyak. Model dasarnya adalah Qwen3, tetapi pertanyaan pelatihannya sebagian besar berupa ilmu komputer berbahasa Inggris, dan Ai2 belum merilis data soal performanya dalam menangani literatur berbahasa Mandarin.
Evaluasi berhenti di tahun 2025
Ai2 sendiri menandai keterbatasannya: evaluasi-evaluasi ini dilakukan pada 2025 dan dibandingkan dengan model terdepan saat itu, belum diulang dengan model masa kini. Jadi klaim "setara dengan pipeline Claude" itu merujuk pada generasi Claude 3.7, sementara Anthropic saat ini sudah merilis Opus 5.5.
Ai2 juga menunjukkan satu kelemahan yang tidak tertangkap oleh metrik sitasi: model bisa saja mengutip literatur yang tepat, tetapi menyampaikannya lebih meyakinkan daripada aslinya — misalnya mengubah temuan dari satu sampel spesifik menjadi aturan umum, atau mengubah hasil deskriptif menjadi rekomendasi tindakan. Keempat metrik yang ada saat ini belum bisa mengukur penyimpangan semacam itu, dan Ai2 mengatakan langkah berikutnya adalah menguji secara khusus apakah model tetap berada dalam batas cakupan dan kekuatan bukti dari klaim aslinya.
Sumber: blog resmi Ai2, CocoLoop; waktu pembuatan, jumlah sampel pelatihan, dan persentase penggunaan mengikuti data yang diungkap Ai2; kebutuhan VRAM merupakan estimasi editorial.