艾伦人工智能研究所(Ai2)10 月 2 日开源了 AstaBrief 8B,一个专门把研究问题和检索到的文献片段写成带引用科研报告的模型。它基于阿里的 Qwen3-8B 微调,权重和训练数据都已放上 Hugging Face,Ai2 另在 GitHub 给了一个用自有 PDF 改造报告流程的示例。
AstaBrief 现在是 Ai2 科研智能体平台 Asta 里”Fast 模式”的底座。原来的 Thinking 模式由 Claude 驱动,平均一份报告要 178.5 秒;换成 AstaBrief 后平均 51.1 秒,快了约 3.5 倍。Ai2 在博客里这样解释动机:
“We wanted to help scientists generate cited reports faster, with a model they could download and run themselves.” (我们想帮科研人员更快写出带引用的报告,用的还是他们能自己下载、自己跑的模型。)
不碰强化学习,只做两轮数据
训练分两段。监督微调阶段,Ai2 从 Asta 真实用户提问里筛出 9 万条,用 Claude 3.5/3.7 Sonnet、o3、o4-mini 和 GPT-4.1 生成目标答案,最后留下约 4.7 万条可用样本。偏好优化(DPO)阶段换了一批问题:一边是 Claude 驱动的 ScholarQA 流程写出的报告,另一边是 o3、o4-mini、DeepSeek-V3 或 DeepSeek-R1 的版本,由 GPT-4.1 和 DeepSeek-R1 两个裁判比对,两者意见一致才留下,最终约 6000 条。Ai2 称这两个裁判与人工判断的一致率为 95%。
团队没用强化学习,理由是不稳定、成本高。流程也做了减法:整篇报告一次写完,不再逐节生成,省掉了片段摘要和聚类两个费算力的环节。
几种数据过滤办法里,效果最明显的一条很朴素:把引用密度低的合成样本剔掉。Ai2 的总结是,“输出有没有依据”这种直接信号,比层层设计的复杂过滤更管用。
和闭源流水线放在一起比
主评测用的是 SQABench-CS2,200 道计算机科学问题,看四项:内容覆盖、段落相关性、引用能否支撑论断、论断是否都有引用。在大模型当裁判的对比里,AstaBrief 和 Claude 驱动的流程、Ai2 早先开源的研究模型 DR Tulu 互有高低。人工评测规模不大:3 位研究者各看 14 到 15 道题,其中两位把 AstaBrief 的引用准确度排在第一。另一个基准 DeepScholarBench 取自近期 arXiv 论文,共 63 个问题。
线上数据来自 374 名 Asta 用户:29.1% 在两天以上用过 Fast 模式,人均生成 3.67 个报告对话;23% 之后只用 Fast,18% 在两种模式之间来回切换。
同类工具里,OpenAI 和谷歌的深度研究功能都跑在闭源大模型上,用户拿不到权重,也没法把流程搬进自己的文献库。AstaBrief 的取舍是把规模压到 8B,换成可下载、可改造。粗略估算,半精度权重约 16GB,一张 24GB 显存的显卡就能加载,高校实验室接入的门槛低了不少。基座是 Qwen3,不过训练用的提问以英文计算机科学为主,处理中文文献的效果,Ai2 没有给出数据。
评测停在 2025 年
Ai2 自己标出了限制:这些评测在 2025 年做完,对照的是当时的前沿模型,没拿今天的模型重跑。所以”跟 Claude 流程打得有来有回”,对应的是 Claude 3.7 那一代,眼下 Anthropic 已经发到 Opus 5.5。
Ai2 还点了一个引用指标抓不住的毛病:模型可能引对了文献,却把话说得比原文更满,比如把特定样本里的发现推成普遍规律,或者把描述性结果写成操作建议。现有四项指标量不出这种偏差,Ai2 说下一步要专门测模型能否守住原始论断的范围和证据强度。
参考来源:Ai2 官方博客、CocoLoop;生成耗时、训练样本规模与用户使用比例以 Ai2 披露口径为准,显存需求为编辑估算。