Ai2 lança modelo open source de 8B para relatórios científicos, 3,5x mais rápido

O Allen Institute for AI (Ai2) lançou em código aberto, em 2 de outubro, o AstaBrief 8B, um modelo dedicado a transformar perguntas de pesquisa e trechos de literatura recuperados em relatórios científicos com citações. Ele é um ajuste fino do Qwen3-8B da Alibaba; os pesos e os dados de treinamento já estão no Hugging Face, e no GitHub a Ai2 também disponibilizou um exemplo de como reconstruir o pipeline de relatórios usando PDFs próprios.

O AstaBrief agora é a base do "modo Fast" no Asta, a plataforma de agentes de pesquisa da Ai2. O antigo modo Thinking era conduzido pelo Claude e levava, em média, 178,5 segundos por relatório; com o AstaBrief, a média cai para 51,1 segundos, cerca de 3,5 vezes mais rápido. A Ai2 explica a motivação assim, em seu blog:

"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."

(Queríamos ajudar cientistas a gerar relatórios com citações mais rápido, usando um modelo que eles próprios pudessem baixar e executar.)

Sem aprendizado por reforço, só duas rodadas de dados

O treinamento ocorre em duas etapas. Na fase de ajuste fino supervisionado, a Ai2 selecionou 90 mil perguntas reais de usuários do Asta e usou Claude 3.5/3.7 Sonnet, o3, o4-mini e GPT-4.1 para gerar respostas de referência, restando ao final cerca de 47 mil amostras utilizáveis.

A fase de otimização de preferências (DPO) usou outro conjunto de perguntas: de um lado, relatórios gerados pelo pipeline ScholarQA baseado em Claude; do outro, versões de o3, o4-mini, DeepSeek-V3 ou DeepSeek-R1. Dois "juízes", GPT-4.1 e DeepSeek-R1, compararam os pares, e só foram mantidos os casos em que ambos concordaram, resultando em cerca de 6 mil amostras. A Ai2 afirma que a taxa de concordância desses dois juízes com avaliações humanas é de 95%.

A equipe não usou aprendizado por reforço, por considerá-lo instável e caro. O processo também foi simplificado: o relatório inteiro é escrito de uma só vez, em vez de seção por seção, eliminando as etapas de resumo de trechos e agrupamento, que consomem muito poder computacional.

Entre os métodos de filtragem de dados testados, o mais eficaz foi também o mais simples: eliminar amostras sintéticas com baixa densidade de citações. A conclusão da Ai2 é que um sinal direto como "o resultado tem fundamento ou não" funciona melhor do que filtros complexos e em camadas.

Comparado a pipelines de código fechado

A avaliação principal usou o SQABench-CS2, com 200 perguntas de ciência da computação, observando quatro aspectos: cobertura de conteúdo, relevância dos parágrafos, se as citações sustentam as afirmações e se todas as afirmações têm citação. Nas comparações com um modelo grande como juiz, o AstaBrief, o pipeline baseado em Claude e o DR Tulu — modelo de pesquisa que a Ai2 já havia lançado em código aberto — alternaram vitórias entre si.

A avaliação humana teve escala pequena: três pesquisadores analisaram de 14 a 15 perguntas cada, e dois deles colocaram a precisão de citações do AstaBrief em primeiro lugar. Outro benchmark, o DeepScholarBench, usa artigos recentes do arXiv, totalizando 63 perguntas.

Os dados de uso real vêm de 374 usuários do Asta: 29,1% usaram o modo Fast por mais de dois dias, com média de 3,67 diálogos de relatório por pessoa; 23% passaram a usar só o Fast depois disso, e 18% alternaram entre os dois modos.

Entre ferramentas semelhantes, os recursos de pesquisa profunda da OpenAI e do Google rodam em modelos grandes de código fechado: os usuários não têm acesso aos pesos e não conseguem levar o pipeline para sua própria base de literatura. A escolha do AstaBrief foi reduzir a escala para 8B em troca de ser baixável e adaptável. Por estimativa aproximada, os pesos em meia precisão ocupam cerca de 16 GB, e uma placa de vídeo com 24 GB de VRAM já é suficiente para carregá-los, reduzindo bastante a barreira de entrada para laboratórios acadêmicos. O modelo-base é o Qwen3, mas as perguntas usadas no treinamento são majoritariamente de ciência da computação em inglês; a Ai2 não apresentou dados sobre o desempenho com literatura em chinês.

Avaliações paradas em 2025

A própria Ai2 apontou uma limitação: essas avaliações foram feitas em 2025, comparadas com os modelos de ponta da época, sem repetição com os modelos atuais. Assim, o resultado de "empate técnico com o pipeline baseado em Claude" corresponde à geração Claude 3.7, enquanto a Anthropic já está na Opus 5.5.

A Ai2 também apontou uma falha que as métricas de citação não capturam: o modelo pode citar a literatura corretamente, mas afirmar algo com mais certeza do que o original permite — por exemplo, transformar um achado de uma amostra específica em uma regra geral, ou converter um resultado descritivo em recomendação de ação. As quatro métricas atuais não medem esse tipo de desvio; segundo a Ai2, o próximo passo é testar especificamente se o modelo mantém o alcance e o grau de evidência da afirmação original.

Fontes: blog oficial da Ai2, CocoLoop; tempo de geração, escala das amostras de treinamento e proporções de uso dos usuários seguem os números divulgados pela Ai2, e a necessidade de VRAM é uma estimativa da redação.