Der naechste Wettbewerb grosser Modelle beginnt moeglicherweise im Aufgabensatz, nicht in der Parametertabelle.
QbitAI berichtete am 9. August ueber BigBang-V1 von The Endless Frontier. Das Modell ist von Qwen3.6-35B-A3B post-trainiert, hat 35B Gesamtparameter, aktiviert bei Inferenz rund 3B Parameter und nutzt standardmaessig 262.144 Tokens Kontext. Modell, Code und technischer Bericht sind oeffentlich.
Der Aufgabengenerator wird Teil des Trainings
Die Model Card beschreibt ein adversariales, selbstentwickelndes Framework fuer synthetische Daten. Generator Agents schlagen immer schwierigere wissenschaftliche und technische Probleme vor und loesen sie. Critic Agents pruefen Korrektheit, Schwierigkeit, Skalierbarkeit und Vielfalt.
Der gemeldete Umfang liegt bei etwa 10.000 schwierigen Post-Training-Beispielen. Entscheidend ist nicht Masse, sondern dass die Datenpipeline Themenfeld, Denkkettenlaenge, Tool-Nutzung und Filterstrategie anpasst.
“AI advancing science, and science advancing AI.”
Der Satz traegt nur, wenn Aufgaben verifizierbar sind. BigBang setzt auf Probleme, die sich durch Codeausfuehrung, numerische Berechnung, Simulation, formale Methoden oder Fachtools pruefen lassen.
Scores brauchen Protokoll
BigBang-V1 wird als bestes ausgewaehltes 35B-Modell auf acht repraesentativen Benchmarks gemeldet. Auf FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev) und BioMysteryBench-HD liegt es vor DeepSeek V4 Pro Preview.
Die Kernwerte: BrowseComp 76,5, SWE-Bench Pro 54,2, FrontierScience Research 46,2 und PaperBench(Code-Dev) 53,6. Der Vergleich braucht dennoch Vorsicht: Einige Benchmarks laufen ueber den General-Agent-Runner des Repos, SWE-Bench Pro und SciCode-Verified ueber ihre offiziellen Harnesses.
Die Pruefkette ist entscheidend
Das GitHub-Repo dokumentiert eine Decontamination-Policy fuer Evaluationen. Hugging-Face-Seiten werden aus der Suche gefiltert, direkte Besuche dieser Domains blockiert und Referenzantworten nicht dem Agenten gezeigt. Die Agentenschleife nutzt search, visit und code_exec, mit maximal 500 Tool Calls pro Trajektorie.
Der naechste Test ist Reproduktion durch Dritte: offenes Modell ausfuehren, 262K-Kontext pruefen und sehen, ob sich die Datenproduktionsidee auf andere Domaenen uebertragen laesst. Fuer Chinas Modellbranche ist das ein klares Signal: Verifizierbare Aufgabenfabriken werden Infrastruktur.
Quellen: QbitAI, Hugging-Face-Model-Card, GitHub-Repository, technischer Bericht von Endless Frontier, CocoLoop; geprueft wurden BigBang-V1-Parameterumfang, 3B aktive Parameter, 262K Kontext, etwa 10.000 Post-Training-Beispiele, Benchmark-Scores, Evaluations-Harnesses und Decontamination-Policy.