El Allen Institute for AI (Ai2) liberó en código abierto, el 2 de octubre, AstaBrief 8B, un modelo dedicado a convertir preguntas de investigación y fragmentos de literatura recuperados en informes científicos con citas. Está ajustado a partir del Qwen3-8B de Alibaba; los pesos y los datos de entrenamiento ya están en Hugging Face, y en GitHub Ai2 ofrece además un ejemplo para reconstruir el flujo de informes usando PDFs propios.
AstaBrief es ahora la base del "modo Fast" en Asta, la plataforma de agentes de investigación de Ai2. El antiguo modo Thinking funcionaba con Claude y tardaba en promedio 178,5 segundos por informe; con AstaBrief, el promedio baja a 51,1 segundos, unas 3,5 veces más rápido. Ai2 explica así la motivación en su blog:
"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."
(Queríamos ayudar a los científicos a generar informes con citas más rápido, con un modelo que ellos mismos pudieran descargar y ejecutar.)
Sin aprendizaje por refuerzo, solo dos rondas de datos
El entrenamiento se divide en dos etapas. En la fase de ajuste fino supervisado, Ai2 filtró 90.000 preguntas reales de usuarios de Asta y usó Claude 3.5/3.7 Sonnet, o3, o4-mini y GPT-4.1 para generar respuestas objetivo, quedando al final unas 47.000 muestras utilizables.
La fase de optimización de preferencias (DPO) usó otro lote de preguntas: por un lado, informes escritos por el flujo ScholarQA impulsado por Claude; por otro, versiones de o3, o4-mini, DeepSeek-V3 o DeepSeek-R1. Dos "jueces", GPT-4.1 y DeepSeek-R1, compararon los pares, y solo se conservaron los casos en que ambos coincidían, quedando al final unas 6.000 muestras. Ai2 afirma que la tasa de coincidencia de estos dos jueces con el juicio humano es del 95%.
El equipo no usó aprendizaje por refuerzo porque lo consideran inestable y costoso. El proceso también se simplificó: el informe completo se escribe de una sola vez, en lugar de sección por sección, eliminando los pasos de resumen de fragmentos y agrupamiento, que consumen mucho cómputo.
Entre los métodos de filtrado de datos probados, el más eficaz fue también el más simple: eliminar las muestras sintéticas con baja densidad de citas. La conclusión de Ai2 es que una señal directa como "si la salida tiene fundamento o no" funciona mejor que filtros complejos de varias capas.
Comparado con flujos de código cerrado
La evaluación principal usó SQABench-CS2, con 200 preguntas de ciencias de la computación, observando cuatro aspectos: cobertura de contenido, relevancia de los párrafos, si las citas respaldan las afirmaciones y si todas las afirmaciones tienen cita. En las comparaciones con un modelo grande como juez, AstaBrief, el flujo impulsado por Claude y DR Tulu —el modelo de investigación que Ai2 ya había liberado antes— se alternaron en los resultados.
La evaluación humana fue de escala pequeña: tres investigadores revisaron entre 14 y 15 preguntas cada uno, y dos de ellos situaron la precisión de citas de AstaBrief en primer lugar. Otro referente, DeepScholarBench, toma artículos recientes de arXiv, con un total de 63 preguntas.
Los datos de uso real provienen de 374 usuarios de Asta: el 29,1% usó el modo Fast durante más de dos días, con un promedio de 3,67 diálogos de informe por persona; el 23% pasó a usar solo Fast después, y el 18% alternó entre ambos modos.
Entre herramientas similares, las funciones de investigación profunda de OpenAI y Google funcionan con modelos grandes de código cerrado: los usuarios no obtienen los pesos ni pueden llevar el flujo a su propia biblioteca de literatura. La apuesta de AstaBrief es reducir la escala a 8B a cambio de ser descargable y adaptable. Según una estimación aproximada, los pesos en precisión media ocupan unos 16 GB, y una tarjeta gráfica con 24 GB de VRAM basta para cargarlos, lo que reduce bastante la barrera de entrada para los laboratorios universitarios. El modelo base es Qwen3, pero las preguntas usadas en el entrenamiento son mayoritariamente de ciencias de la computación en inglés; Ai2 no ha presentado datos sobre el rendimiento con literatura en chino.
Las evaluaciones se detienen en 2025
La propia Ai2 señaló una limitación: estas evaluaciones se hicieron en 2025, comparadas con los modelos de vanguardia de ese momento, sin repetirse con los modelos actuales. Así, el resultado de "empate técnico con el flujo impulsado por Claude" corresponde a la generación Claude 3.7, mientras que Anthropic ya ha llegado a Opus 5.5.
Ai2 también señaló un fallo que las métricas de citas no detectan: el modelo puede citar correctamente la literatura, pero afirmar algo con más seguridad de la que permite el original, por ejemplo convirtiendo un hallazgo de una muestra concreta en una regla general, o transformando un resultado descriptivo en una recomendación de acción. Las cuatro métricas actuales no miden este tipo de desviación; Ai2 dice que el siguiente paso es evaluar específicamente si el modelo respeta el alcance y el grado de evidencia de la afirmación original.
Fuentes: blog oficial de Ai2, CocoLoop; el tiempo de generación, la escala de las muestras de entrenamiento y las proporciones de uso de los usuarios siguen las cifras publicadas por Ai2, y el requisito de VRAM es una estimación de la redacción.