Ai2が研究レポート生成8Bモデルを公開

米Allen Institute for AI(Ai2)は10月2日、研究課題と検索した文献の断片から引用付きの研究レポートを書くことに特化したモデル「AstaBrief 8B」をオープンソースで公開した。アリババのQwen3-8Bをファインチューニングしたもので、重みと学習データはHugging Faceに公開されている。Ai2はGitHubでも、自前のPDFを使ってレポート生成パイプラインを改造する例を示している。

AstaBriefは現在、Ai2の研究エージェントプラットフォーム「Asta」の「Fastモード」の基盤モデルになっている。もともとのThinkingモードはClaudeベースで、レポート1件あたり平均178.5秒かかっていたが、AstaBriefに切り替えたことで平均51.1秒に短縮され、約3.5倍速くなった。Ai2はブログでこの狙いを次のように説明している。

"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."

(科学者がダウンロードして自分で動かせるモデルで、より速く引用付きレポートを作れるようにしたかった、とのことだ。)

強化学習を使わず、データ作りは2段階のみ

学習は2段階に分かれる。教師ありファインチューニング(SFT)の段階では、Astaの実際のユーザーからの質問9万件を抽出し、Claude 3.5/3.7 Sonnet、o3、o4-mini、GPT-4.1で目標回答を生成し、最終的に使えるサンプルは約4万7000件となった。好み最適化(DPO)の段階では別の質問セットを使い、一方はClaudeベースのScholarQAパイプラインが書いたレポート、もう一方はo3、o4-mini、DeepSeek-V3またはDeepSeek-R1によるレポートを用意し、GPT-4.1とDeepSeek-R1という2つの判定モデルで比較、両者の判定が一致したペアのみを残して最終的に約6000件になった。Ai2によると、この2つの判定モデルは人間の判断と95%の割合で一致したという。

チームは強化学習を使わなかった。不安定でコストが高いためだという。パイプラインも簡略化し、節ごとに生成するのではなくレポート全体を一度に書き上げる方式にして、断片の要約とクラスタリングという計算コストの高い工程を省いた。

複数のデータフィルタリング手法のうち、最も効果があったのは単純な方法だった。引用密度の低い合成サンプルを取り除くというものだ。Ai2のまとめによれば、「出力に根拠があるかどうか」という直接的な信号は、入念に設計した複雑なフィルタリングより効果的だという。

クローズドソースのパイプラインと比較

主な評価にはSQABench-CS2を使用した。これはコンピュータサイエンスの問題200問で、内容のカバー範囲、段落の関連性、引用が主張を裏付けているか、すべての主張に引用があるかの4項目を見る。大規模モデルを判定役にした比較では、AstaBriefはClaudeベースのパイプラインや、Ai2が以前公開した研究モデルDR Tuluと、互いに優劣が分かれた。人間による評価は小規模で、研究者3人がそれぞれ14〜15問を評価し、そのうち2人がAstaBriefの引用精度を1位に挙げた。もう一つの基準であるDeepScholarBenchは、最近のarXiv論文から取った63問で構成される。

実運用データはAstaの利用者374人から得られたもので、29.1%が2日以上Fastモードを使用し、1人当たり平均3.67件のレポート対話を生成した。23%はその後Fastモードのみを使うようになり、18%は両モードを切り替えて使っていた。

同種のツールでは、OpenAIとGoogleの深度研究機能はいずれもクローズドソースの大規模モデル上で動いており、ユーザーは重みを入手できず、パイプラインを自分の文献ライブラリに組み込むこともできない。AstaBriefのトレードオフは、モデルを8Bまで小型化する代わりに、ダウンロードと改造が可能になったことだ。ざっと見積もると、半精度の重みは約16GBで、24GB VRAMのGPU1枚で読み込める規模であり、大学の研究室が導入する際のハードルはかなり下がる。ベースはQwen3だが、学習に使った質問は英語のコンピュータサイエンス分野が中心で、中国語文献を扱った際の性能についてAi2はデータを示していない。

評価は2025年時点で止まっている

Ai2自身が限界を明示している。これらの評価は2025年に実施されたもので、当時の最先端モデルとの比較であり、現在のモデルで再実施したものではない。つまり「Claudeのパイプラインと互角に渡り合う」という結果は、Claude 3.7世代を相手にしたものであり、Anthropicはすでに Opus 5.5まで世代を進めている。

Ai2はまた、引用指標では捉えられない弱点も指摘している。モデルは正しい文献を引用していても、内容を元の記述より強く言い切ってしまうことがある。例えば、特定のサンプルで得られた発見を一般的な法則のように書いたり、記述的な結果を行動の提案に書き換えたりするケースだ。既存の4つの指標ではこうしたズレを測れないため、Ai2は次のステップとして、モデルが元の主張の範囲と根拠の強さを守れているかを専門的に検証する計画だという。

参考資料:Ai2公式ブログ、CocoLoop;生成時間、学習サンプル数、利用率はAi2の開示情報に基づく。VRAM要件は編集部による推定。