La prochaine competition entre grands modeles pourrait commencer dans le jeu de taches, pas dans le tableau des parametres.
Le 9 aout, QbitAI a rapporte la sortie de BigBang-V1 par The Endless Frontier. Le modele est post-entraine depuis Qwen3.6-35B-A3B, avec 35B parametres au total, environ 3B actifs en inference et une fenetre de contexte par defaut de 262 144 tokens. Le modele, le code et le rapport technique sont publics.
Le generateur de taches entre dans l'entrainement
La model card decrit un cadre adversarial et autoevolutif de donnees synthetiques. Les Generator agents proposent et resolvent des problemes scientifiques et techniques de plus en plus difficiles. Les Critic agents verifient exactitude, difficulte, scalabilite et diversite.
L'echelle annoncee est d'environ 10 000 exemples difficiles de post-training. Le sujet n'est pas le volume, mais un pipeline qui ajuste domaine, longueur de raisonnement, usage d'outils et filtrage.
“AI advancing science, and science advancing AI.”
Cette formule ne vaut que si les taches sont verifiables. BigBang s'appuie sur des problemes controlables par execution de code, calcul numerique, simulation, methodes formelles ou outils de domaine.
Les scores se lisent avec le protocole
BigBang-V1 est presente comme le meilleur modele 35B selectionne sur huit benchmarks representatifs. Il depasse aussi DeepSeek V4 Pro Preview sur FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev) et BioMysteryBench-HD.
Les chiffres cles incluent BrowseComp 76,5, SWE-Bench Pro 54,2, FrontierScience Research 46,2 et PaperBench(Code-Dev) 53,6. La comparaison demande prudence: certains benchmarks utilisent le general-agent runner du depot; SWE-Bench Pro et SciCode-Verified utilisent leurs harnesses officiels.
La chaine de verification compte le plus
Le depot GitHub documente une politique de decontamination en evaluation. Les pages Hugging Face sont filtrees de la recherche, les visites directes vers ces domaines sont bloquees et les reponses de reference ne sont pas exposees a l'agent. La boucle utilise search, visit et code_exec, avec 500 appels d'outils maximum par trajectoire.
Le prochain test sera la reproduction par des tiers: lancer le modele ouvert, verifier le contexte 262K et voir si la meme idee de production de donnees sort de la recherche, du code et de la recherche longue. Pour l'ecosysteme chinois, le signal est clair: les usines de taches verifiables deviennent une infrastructure.
Sources: QbitAI, model card Hugging Face, depot GitHub, rapport technique Endless Frontier, CocoLoop; verification de l'echelle de BigBang-V1, des 3B parametres actifs, du contexte 262K, d'environ 10 000 exemples de post-training, des scores de benchmark, des harnesses d'evaluation et de la politique de decontamination.