La siguiente competencia entre grandes modelos podria empezar en el banco de tareas, no en la tabla de parametros.
El 9 de agosto, QbitAI reporto BigBang-V1, del equipo The Endless Frontier. El modelo se post-entreno a partir de Qwen3.6-35B-A3B, tiene 35B parametros totales, alrededor de 3B activos en inferencia y una ventana de contexto predeterminada de 262.144 tokens. Modelo, codigo e informe tecnico son publicos.
El generador de tareas entra al entrenamiento
La model card describe un marco adversarial y autoevolutivo de datos sinteticos. Los Generator agents proponen y resuelven problemas cientificos y tecnicos cada vez mas dificiles. Los Critic agents revisan correccion, dificultad, escalabilidad y diversidad.
La escala reportada es de unos 10.000 ejemplos dificiles de post-training. Lo importante no es el volumen, sino que el pipeline ajusta dominio, longitud de razonamiento, uso de herramientas y estrategia de filtrado.
“AI advancing science, and science advancing AI.”
Esa frase solo se sostiene si las tareas son verificables. BigBang se apoya en problemas que pueden comprobarse con ejecucion de codigo, calculo numerico, simulacion, metodos formales o herramientas de dominio.
Los puntajes se leen con el protocolo
BigBang-V1 se reporta como el mejor entre modelos 35B seleccionados en ocho benchmarks representativos. Tambien supera a DeepSeek V4 Pro Preview en FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev) y BioMysteryBench-HD.
Los numeros clave incluyen BrowseComp 76,5, SWE-Bench Pro 54,2, FrontierScience Research 46,2 y PaperBench(Code-Dev) 53,6. La comparacion requiere cuidado: algunos benchmarks usan el general-agent runner del repositorio; SWE-Bench Pro y SciCode-Verified usan sus harnesses oficiales.
La cadena de verificacion manda
El repositorio GitHub documenta una politica de decontamination durante la evaluacion. Se filtran paginas de Hugging Face en la busqueda, se bloquean visitas directas a esos dominios y no se exponen respuestas de referencia al agente. El bucle usa search, visit y code_exec, con limite de 500 llamadas de herramienta por trayectoria.
La prueba siguiente es reproduccion externa: ejecutar el modelo abierto, verificar el contexto de 262K y medir si la misma idea de produccion de datos funciona fuera de investigacion, codigo y busqueda larga. Para el ecosistema chino, el mensaje es claro: las fabricas de tareas verificables se estan volviendo infraestructura.
Fuentes: QbitAI, model card de Hugging Face, repositorio GitHub, informe tecnico de Endless Frontier, CocoLoop; verificacion de escala de parametros de BigBang-V1, 3B parametros activos, contexto 262K, unos 10.000 ejemplos de post-training, puntajes de benchmark, harnesses de evaluacion y politica de decontamination.