A proxima competicao entre grandes modelos pode comecar no conjunto de tarefas, nao na tabela de parametros.
Em 9 de agosto, a QbitAI reportou o BigBang-V1 da equipe The Endless Frontier. O modelo vem de post-training sobre Qwen3.6-35B-A3B, tem 35B parametros totais, cerca de 3B ativos na inferencia e contexto padrao de 262.144 tokens. Modelo, codigo e relatorio tecnico estao publicos.
O gerador de tarefas entra no treino
O model card descreve uma estrutura adversarial e autoevolutiva de dados sinteticos. Generator agents propoem e resolvem problemas cientificos e tecnicos mais dificeis. Critic agents verificam correcao, dificuldade, escalabilidade e diversidade.
A escala relatada e de cerca de 10.000 exemplos dificeis de post-training. O ponto nao e volume bruto. O pipeline muda dominio, comprimento de raciocinio, uso de ferramentas e estrategia de filtro conforme o modelo evolui.
“AI advancing science, and science advancing AI.”
Essa frase so funciona quando as tarefas podem ser verificadas. BigBang privilegia problemas checaveis por execucao de codigo, calculo numerico, simulacao, metodos formais ou ferramentas de dominio.
Leia os scores junto do protocolo
BigBang-V1 e reportado como o melhor entre modelos 35B selecionados em oito benchmarks representativos. Tambem supera DeepSeek V4 Pro Preview em FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev) e BioMysteryBench-HD.
Os numeros incluem BrowseComp 76,5, SWE-Bench Pro 54,2, FrontierScience Research 46,2 e PaperBench(Code-Dev) 53,6. A comparacao precisa de cuidado: alguns benchmarks usam o general-agent runner do repositorio; SWE-Bench Pro e SciCode-Verified usam os harnesses oficiais de cada benchmark.
A cadeia de verificacao e o centro
O repositorio GitHub documenta uma politica de decontamination na avaliacao. Paginas da Hugging Face sao filtradas da busca, visitas diretas a esses dominios sao bloqueadas e respostas de referencia nao aparecem para o agente. O loop usa search, visit e code_exec, com limite de 500 chamadas de ferramenta por trajetoria.
O teste agora e reproducao independente: rodar o modelo aberto, validar o contexto de 262K e medir se a mesma ideia de producao de dados funciona fora de pesquisa, codigo e busca longa. Para o ecossistema chines de modelos, a mensagem e direta: fabricas de tarefas verificaveis estao virando infraestrutura.
Fontes: QbitAI, model card do Hugging Face, repositorio GitHub, relatorio tecnico da Endless Frontier, CocoLoop; verificacao cobre escala de parametros do BigBang-V1, 3B parametros ativos, contexto 262K, cerca de 10.000 exemplos de post-training, scores de benchmark, harnesses de avaliacao e politica de decontamination.