BigBang Membuat Model Menulis Tugas

Kompetisi model besar berikutnya bisa dimulai dari kumpulan tugas, bukan dari tabel parameter.

Pada 9 Agustus, QbitAI melaporkan rilis BigBang-V1 dari tim The Endless Frontier. Model ini dipost-training dari Qwen3.6-35B-A3B, memiliki 35B parameter total, sekitar 3B parameter aktif saat inferensi, dan konteks default 262.144 token. Model, kode, dan laporan teknis sudah terbuka.

Generator tugas masuk ke proses training

Kartu model menyebut BigBang memakai kerangka data sintetis yang adversarial dan self-evolving. Generator agent mengusulkan dan menyelesaikan masalah ilmiah serta teknis yang makin sulit. Critic agent memeriksa kebenaran, tingkat kesulitan, skalabilitas, dan keberagaman.

Skala yang dilaporkan sekitar 10.000 contoh post-training tingkat sulit. Nilainya bukan pada jumlah massal, melainkan pada pipeline data yang ikut mengubah bidang tugas, panjang rantai penalaran, penggunaan alat, dan strategi penyaringan.

“AI advancing science, and science advancing AI.”

Kalimat itu hanya kuat jika tugasnya bisa diverifikasi. BigBang memilih masalah yang dapat dicek lewat eksekusi kode, komputasi numerik, simulasi, metode formal, atau alat domain.

Skor perlu dibaca bersama protokol

BigBang-V1 dilaporkan menjadi yang tertinggi di antara model 35B terpilih pada delapan benchmark representatif. Model ini juga melampaui DeepSeek V4 Pro Preview pada FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev), dan BioMysteryBench-HD.

Angka kuncinya mencakup BrowseComp 76,5, SWE-Bench Pro 54,2, FrontierScience Research 46,2, dan PaperBench(Code-Dev) 53,6. Namun perbandingan lintas model perlu hati-hati: sebagian benchmark memakai general-agent runner dari repositori, sedangkan SWE-Bench Pro dan SciCode-Verified memakai harness resmi masing-masing.

Rantai verifikasi menjadi pusat cerita

Repositori GitHub juga menjelaskan kebijakan decontamination saat evaluasi. Halaman Hugging Face disaring dari pencarian, kunjungan langsung ke domain itu diblokir, dan jawaban referensi tidak ditampilkan kepada agent. Loop umum memakai search, visit, dan code_exec, dengan batas 500 tool call per trajektori.

Tes berikutnya adalah reproduksi pihak ketiga, penggunaan konteks 262K secara nyata, dan apakah ide produksi data ini berpindah ke domain di luar riset, coding, dan pencarian panjang. Untuk ekosistem model China, sinyalnya jelas: produksi data yang dapat diverifikasi mulai menjadi infrastruktur inti.

Sumber: QbitAI, kartu model Hugging Face, repositori GitHub, laporan teknis Endless Frontier, CocoLoop; verifikasi mencakup skala parameter BigBang-V1, 3B parameter aktif, konteks 262K, sekitar 10.000 contoh post-training, skor benchmark, harness evaluasi, dan kebijakan decontamination.