L'Allen Institute for AI (Ai2) a publié en open source, le 2 octobre, AstaBrief 8B, un modèle spécialisé dans la transformation de questions de recherche et d'extraits de littérature récupérés en rapports scientifiques sourcés. Il s'agit d'un fine-tuning du Qwen3-8B d'Alibaba ; les poids et les données d'entraînement sont déjà sur Hugging Face, et sur GitHub, Ai2 fournit en plus un exemple permettant de reconstruire le pipeline de rapports avec ses propres PDF.
AstaBrief est désormais la base du « mode Fast » sur Asta, la plateforme d'agents de recherche d'Ai2. L'ancien mode Thinking, piloté par Claude, nécessitait en moyenne 178,5 secondes par rapport ; avec AstaBrief, la moyenne tombe à 51,1 secondes, soit environ 3,5 fois plus rapide. Ai2 explique cette motivation ainsi sur son blog :
"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."
(Nous voulions aider les scientifiques à générer des rapports sourcés plus rapidement, avec un modèle qu'ils pouvaient télécharger et exécuter eux-mêmes.)
Pas d'apprentissage par renforcement, seulement deux cycles de données
L'entraînement se déroule en deux étapes. Lors de la phase de fine-tuning supervisé, Ai2 a filtré 90 000 questions réelles d'utilisateurs d'Asta et utilisé Claude 3.5/3.7 Sonnet, o3, o4-mini et GPT-4.1 pour générer des réponses cibles, ne conservant finalement qu'environ 47 000 échantillons exploitables.
La phase d'optimisation des préférences (DPO) a utilisé un autre lot de questions : d'un côté, des rapports rédigés par le pipeline ScholarQA piloté par Claude ; de l'autre, des versions issues de o3, o4-mini, DeepSeek-V3 ou DeepSeek-R1. Deux « juges », GPT-4.1 et DeepSeek-R1, ont comparé les paires, et seuls les cas où les deux étaient d'accord ont été retenus, soit environ 6 000 échantillons au final. Ai2 indique que le taux d'accord de ces deux juges avec le jugement humain est de 95 %.
L'équipe n'a pas utilisé d'apprentissage par renforcement, le jugeant instable et coûteux. Le processus a également été simplifié : le rapport entier est rédigé en une seule fois, et non section par section, ce qui supprime les deux étapes gourmandes en calcul que sont le résumé des extraits et le clustering.
Parmi les méthodes de filtrage des données testées, la plus efficace était aussi la plus simple : éliminer les échantillons synthétiques à faible densité de citations. La conclusion d'Ai2 est qu'un signal direct comme « la sortie est-elle fondée ou non » fonctionne mieux que des filtres complexes à plusieurs niveaux.
Face aux pipelines à code fermé
L'évaluation principale a utilisé SQABench-CS2, 200 questions d'informatique, en examinant quatre critères : couverture du contenu, pertinence des paragraphes, capacité des citations à étayer les affirmations, et présence de citations pour chaque affirmation. Dans les comparaisons où un grand modèle sert de juge, AstaBrief, le pipeline piloté par Claude et DR Tulu — le modèle de recherche open source précédemment publié par Ai2 — se sont alternativement surpassés.
L'évaluation humaine était de petite envergure : trois chercheurs ont chacun examiné 14 à 15 questions, et deux d'entre eux ont classé la précision des citations d'AstaBrief en première place. Un autre benchmark, DeepScholarBench, s'appuie sur des articles arXiv récents, pour un total de 63 questions.
Les données d'usage réel proviennent de 374 utilisateurs d'Asta : 29,1 % ont utilisé le mode Fast pendant plus de deux jours, avec une moyenne de 3,67 dialogues de rapport par personne ; 23 % n'ont ensuite utilisé que Fast, et 18 % ont alterné entre les deux modes.
Parmi les outils comparables, les fonctions de recherche approfondie d'OpenAI et de Google fonctionnent toutes deux sur des grands modèles à code fermé : les utilisateurs n'ont pas accès aux poids et ne peuvent pas intégrer le pipeline à leur propre base documentaire. Le choix d'AstaBrief est de réduire la taille à 8B en échange d'un modèle téléchargeable et modifiable. Selon une estimation grossière, les poids en demi-précision pèsent environ 16 Go, et une carte graphique avec 24 Go de VRAM suffit à les charger, ce qui abaisse nettement la barrière d'entrée pour les laboratoires universitaires. Le modèle de base est Qwen3, mais les questions utilisées pour l'entraînement sont majoritairement des questions d'informatique en anglais ; Ai2 n'a pas fourni de données sur les performances avec de la littérature en chinois.
Des évaluations arrêtées à 2025
Ai2 a elle-même souligné une limite : ces évaluations ont été réalisées en 2025, comparées aux modèles de pointe de l'époque, sans être rejouées avec les modèles actuels. Le résultat « au coude à coude avec le pipeline piloté par Claude » correspond donc à la génération Claude 3.7, alors qu'Anthropic en est aujourd'hui à Opus 5.5.
Ai2 relève aussi un défaut que les métriques de citation ne saisissent pas : le modèle peut citer correctement la littérature tout en formulant des propos plus affirmatifs que l'original ne le permet — par exemple en transformant une observation issue d'un échantillon précis en règle générale, ou un résultat descriptif en recommandation d'action. Les quatre métriques actuelles ne mesurent pas ce type de biais ; Ai2 indique que la prochaine étape consistera à tester spécifiquement si le modèle respecte la portée et le degré de preuve de l'affirmation d'origine.
Sources : blog officiel d'Ai2, CocoLoop ; durée de génération, taille des échantillons d'entraînement et proportions d'usage des utilisateurs selon les chiffres communiqués par Ai2, le besoin en VRAM étant une estimation de la rédaction.