大模型下一輪競爭,可能不先發生在參數表裡,而發生在題庫裡。
8 月 9 日,量子位報導無盡前沿團隊發布 BigBang-V1。這個模型基於 Qwen3.6-35B-A3B 後訓練,總參數 35B,推理時激活約 3B,預設上下文長度 262,144 tokens。模型、程式碼和技術報告已公開。
題庫變成訓練對象
模型卡寫明,BigBang 採用對抗式、自演化合成資料框架。Generator Agent 負責提出並解決更難的科學與技術任務,Critic Agent 負責檢查正確性、難度、可擴展性與多樣性。
技術報告給出的規模是約 10,000 條高難度後訓練樣本。重點不在大量生成,而在資料管線會調整任務領域、推理鏈長度、工具使用方式和篩選策略。
“AI advancing science, and science advancing AI.”
這句話能成立,前提是任務可驗證。BigBang 選擇能透過程式執行、數值計算、模擬器、形式方法或領域工具檢查的問題。
分數要連同口徑一起看
BigBang-V1 宣稱在選取的 35B 模型中拿到 8 個代表性 benchmark 的最高報告分數,並在 FrontierScience Research、Humanity's Last Exam、PaperBench(Code-Dev)、BioMysteryBench-HD 上超過 DeepSeek V4 Pro Preview。
具體數字包括 BrowseComp 76.5、SWE-Bench Pro 54.2、FrontierScience Research 46.2、PaperBench(Code-Dev) 53.6。不過橫向比較要看評測環境:BrowseComp、xbench、FrontierScience Research、HLE 使用倉庫中的 general-agent runner;SWE-Bench Pro 和 SciCode-Verified 使用各自官方 harness。
核驗鏈才是本體
GitHub 倉庫也公開了評測防污染策略:搜索時過濾 Hugging Face 頁面,阻止直接訪問相關網域,不向 agent 暴露參考答案。一般 agent loop 使用 search、visit、code_exec,單條軌跡最多 500 次工具呼叫。
下一步要看第三方復測、262K 上下文實際部署,以及這套自演化資料方法能否走出科研、程式與長程搜索。對中文模型生態來說,這是一個訊號:價格戰和參數戰之外,可驗證任務工廠正在變成底層能力。
參考來源:量子位、Hugging Face 模型卡、GitHub 倉庫、CocoLoop、Endless Frontier 技術報告;核驗 BigBang-V1 參數規模、3B 激活參數、262K 上下文、約 10,000 條後訓練樣本、Benchmark 分數、評測 harness 與防污染策略。