Ai2 veröffentlicht 8B-Modell für Forschungsberichte, 3,5-mal schneller

Das Allen Institute for AI (Ai2) hat am 2. Oktober AstaBrief 8B als Open Source veröffentlicht – ein Modell, das Forschungsfragen und abgerufene Textausschnitte in zitierte Forschungsberichte verwandelt. Es basiert auf einem Fine-Tuning von Alibabas Qwen3-8B; Gewichte und Trainingsdaten liegen bereits auf Hugging Face, und auf GitHub stellt Ai2 zusätzlich ein Beispiel bereit, mit dem sich der Berichtsprozess mit eigenen PDFs nachbauen lässt.

AstaBrief ist jetzt die Grundlage des „Fast-Modus" auf Asta, Ai2s Plattform für Forschungs-Agenten. Der bisherige Thinking-Modus lief auf Claude und brauchte im Schnitt 178,5 Sekunden pro Bericht; mit AstaBrief sinkt das auf durchschnittlich 51,1 Sekunden, etwa 3,5-mal schneller. Ai2 erklärt die Motivation im eigenen Blog so:

"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."

(Wir wollten Wissenschaftlern helfen, zitierte Berichte schneller zu erstellen – mit einem Modell, das sie selbst herunterladen und selbst betreiben können.)

Kein Reinforcement Learning, nur zwei Datenrunden

Das Training läuft in zwei Phasen. In der Phase des überwachten Fine-Tunings filterte Ai2 90.000 echte Nutzerfragen aus Asta heraus und ließ Claude 3.5/3.7 Sonnet, o3, o4-mini und GPT-4.1 Zielantworten erzeugen; am Ende blieben rund 47.000 verwertbare Beispiele übrig.

In der Phase der Präferenzoptimierung (DPO) kam ein anderer Fragenpool zum Einsatz: Auf der einen Seite standen Berichte aus der Claude-gestützten ScholarQA-Pipeline, auf der anderen Versionen von o3, o4-mini, DeepSeek-V3 oder DeepSeek-R1. Zwei „Richter", GPT-4.1 und DeepSeek-R1, verglichen die Paare, behalten wurde nur, worüber beide einig waren – am Ende rund 6.000 Beispiele. Ai2 gibt die Übereinstimmung dieser beiden Richter mit menschlichen Bewertungen mit 95 % an.

Das Team verzichtete auf Reinforcement Learning, weil es als instabil und teuer gilt. Auch der Prozess wurde vereinfacht: Der gesamte Bericht wird in einem Zug geschrieben statt Abschnitt für Abschnitt, wodurch die rechenintensiven Schritte Passagen-Zusammenfassung und Clustering entfallen.

Unter den verschiedenen Methoden zur Datenfilterung war die wirksamste zugleich die einfachste: synthetische Beispiele mit geringer Zitierdichte wurden einfach aussortiert. Ai2s Fazit: Ein direktes Signal wie „hat die Ausgabe eine Grundlage" bringt mehr als mehrstufige, komplex konstruierte Filter.

Im Vergleich mit Closed-Source-Pipelines

Die Hauptbewertung erfolgte mit SQABench-CS2, 200 Fragen aus der Informatik, anhand von vier Kriterien: inhaltliche Abdeckung, Relevanz der Abschnitte, ob Zitate die Aussagen stützen und ob alle Aussagen belegt sind. In Vergleichen, bei denen ein großes Modell als Richter fungierte, lagen AstaBrief, die Claude-gestützte Pipeline und Ai2s früher veröffentlichtes Forschungsmodell DR Tulu abwechselnd vorne.

Die menschliche Bewertung war klein angelegt: Drei Forscher sahen sich jeweils 14 bis 15 Fragen an, zwei von ihnen setzten die Zitiergenauigkeit von AstaBrief auf Platz eins. Ein weiterer Benchmark, DeepScholarBench, stammt aus aktuellen arXiv-Papern und umfasst 63 Fragen.

Die Nutzungsdaten stammen von 374 Asta-Nutzern: 29,1 % nutzten den Fast-Modus länger als zwei Tage, im Schnitt mit 3,67 Berichtsdialogen pro Person; 23 % wechselten danach ganz zu Fast, 18 % wechselten zwischen beiden Modi hin und her.

Bei vergleichbaren Werkzeugen laufen die Deep-Research-Funktionen von OpenAI und Google beide auf Closed-Source-Großmodellen – Nutzer erhalten keine Gewichte und können den Prozess nicht in ihre eigene Literaturdatenbank integrieren. AstaBrief tauscht dafür Modellgröße gegen Herunterladbarkeit und Anpassbarkeit: auf 8B verkleinert. Grob geschätzt wiegen die Gewichte in halber Genauigkeit rund 16 GB, eine Grafikkarte mit 24 GB VRAM reicht zum Laden – die Einstiegshürde für Hochschullabore sinkt deutlich. Basis ist Qwen3, doch die Trainingsfragen waren überwiegend englischsprachige Informatikfragen; zur Leistung bei chinesischsprachiger Literatur liefert Ai2 keine Daten.

Bewertungen bleiben auf dem Stand von 2025

Ai2 nennt selbst eine Einschränkung: Die Bewertungen wurden 2025 durchgeführt und mit den damaligen Spitzenmodellen verglichen, nicht mit heutigen Modellen wiederholt. Das „Kopf-an-Kopf-Rennen mit der Claude-Pipeline" bezieht sich also auf die Claude-3.7-Generation, während Anthropic inzwischen bei Opus 5.5 angekommen ist.

Ai2 weist außerdem auf eine Schwäche hin, die die Zitiermetriken nicht erfassen: Ein Modell kann korrekt zitieren und trotzdem stärker formulieren, als die Quelle es zulässt – etwa einen Befund aus einer einzelnen Stichprobe zu einer allgemeinen Regel hochstufen oder ein beschreibendes Ergebnis als Handlungsempfehlung ausgeben. Die vier bestehenden Metriken erfassen diese Verzerrung nicht; Ai2 will als Nächstes gezielt prüfen, ob Modelle den Geltungsbereich und die Beweiskraft der ursprünglichen Aussage einhalten.

Quellen: Ai2-Blog, CocoLoop; Generierungsdauer, Umfang der Trainingsdaten und Nutzungsanteile basieren auf Angaben von Ai2, der VRAM-Bedarf ist eine Schätzung der Redaktion.