Ai2開源8B模型寫科研報告 提速3.5倍

艾倫人工智慧研究所(Ai2)於10月2日開源了AstaBrief 8B,這是一個專門把研究問題與檢索到的文獻片段寫成附引用科研報告的模型。它是以阿里巴巴的Qwen3-8B微調而成,權重與訓練資料都已上傳Hugging Face,Ai2另在GitHub提供了一個示範,說明如何用自己的PDF改造報告產生流程。

AstaBrief目前是Ai2研究智能體平台Asta裡「Fast模式」的基礎模型。原本的Thinking模式由Claude驅動,平均一份報告要178.5秒;換成AstaBrief後平均縮短到51.1秒,快了約3.5倍。Ai2在部落格中這樣解釋這麼做的動機:

"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."

(他們想幫助科學家更快寫出附引用的報告,用的還是研究人員自己能下載、能跑的模型。)

不碰強化學習,只做兩輪資料

訓練分兩個階段。監督微調(SFT)階段,Ai2從Asta真實使用者的提問中篩出9萬條,用Claude 3.5/3.7 Sonnet、o3、o4-mini與GPT-4.1產生目標答案,最後留下約4萬7000條可用樣本。偏好優化(DPO)階段換了一批問題:一邊是Claude驅動的ScholarQA流程寫出的報告,另一邊是o3、o4-mini、DeepSeek-V3或DeepSeek-R1的版本,由GPT-4.1與DeepSeek-R1兩個裁判模型比對,只有兩者意見一致才保留,最終約留下6000條。Ai2表示,這兩個裁判模型與人工判斷的一致率達95%。

團隊沒有使用強化學習,理由是不穩定、成本又高。流程也做了簡化:整份報告一次寫完,不再逐節產生,省掉了片段摘要與聚類這兩個耗費算力的環節。

在幾種資料過濾方法裡,效果最明顯的一種其實很樸素:把引用密度偏低的合成樣本剔除。Ai2的結論是,「輸出有沒有根據」這種直接信號,比層層設計的複雜過濾更有用。

拿來跟封閉式流程比較

主要評測用的是SQABench-CS2,共200道電腦科學問題,看四個項目:內容涵蓋度、段落相關性、引用能否支撐論點、以及每個論點是否都有引用。在以大型模型當裁判的比較中,AstaBrief與Claude驅動的流程、以及Ai2先前開源的研究模型DR Tulu互有輸贏。人工評測規模不大:3位研究人員各看14到15題,其中兩位把AstaBrief的引用準確度排在第一。另一個基準DeepScholarBench取自近期的arXiv論文,共63道題。

線上資料來自374位Asta使用者:29.1%曾在兩天以上使用Fast模式,平均每人產生3.67個報告對話;23%之後只用Fast模式,18%則在兩種模式之間來回切換。

在同類工具中,OpenAI與Google的深度研究功能都跑在封閉式大型模型上,使用者拿不到權重,也無法把流程搬進自己的文獻庫。AstaBrief的取捨是把規模壓到8B,換成可下載、可改造。粗略估算,半精度權重約16GB,一張24GB顯示記憶體的顯卡就能載入,大幅降低了大學實驗室導入的門檻。基礎模型是Qwen3,不過訓練用的問題以英文電腦科學為主,處理中文文獻的效果,Ai2並未提供數據。

評測停在2025年

Ai2自己點出了限制:這些評測是在2025年完成的,對照的是當時的前沿模型,並未拿現在的模型重新跑過。所以「跟Claude流程打得有來有回」,對應的其實是Claude 3.7那一代,而Anthropic目前已經推進到Opus 5.5。

Ai2還指出了一個引用指標量不出來的問題:模型可能引用對了文獻,卻把內容講得比原文更篤定,比方把特定樣本裡的發現講成普遍規律,或是把描述性的結果改寫成操作建議。現有四項指標抓不到這種偏差,Ai2表示下一步要專門測試模型是否能守住原始論點的範圍與證據強度。

參考來源:Ai2官方部落格、CocoLoop;產生耗時、訓練樣本規模與使用者比例以Ai2揭露的口徑為準,顯示記憶體需求為編輯部估算。