大模型的下一轮竞争,可能不先发生在参数表里,而发生在题库里。
8 月 9 日,量子位报道了无尽前沿团队发布的 BigBang-V1。这个模型基于 Qwen3.6-35B-A3B 后训练,总参数 35B,推理时激活约 3B,默认上下文长度 262,144 tokens。模型、代码和技术报告已经公开,训练亮点从“又刷了一张榜”转向一套会迭代的 AI 数据生产流程。
这件事的张力在这里:过去合成数据常被担心越训越窄,模型只是在复述上一代模型的偏见;BigBang 团队试图证明,只要任务足够前沿、答案能被程序或领域工具验证,AI 生成的数据未必只能走向塌缩。
35B 模型,把题库变成训练对象
BigBang-V1 的官方模型卡写得很直白:它由 Qwen3.6-35B-A3B 演化而来,使用“对抗式、自进化合成数据框架”做高效后训练。框架里有两类角色:Generator Agent 负责提出并解决更难的科学和技术任务,Critic Agent 负责检查正确性、难度、可扩展性和多样性。
技术报告给出的口径是,这套流程构造了约 10,000 条高难度后训练样本。样本数量不大,重点在生成方式:人类没有逐题预写,模型也没有停在批量扩写问答上,数据生产管线会自己调整任务领域、推理链长度、工具使用方式和筛选策略。
团队给这条路线留了一句英文判断:
“AI advancing science, and science advancing AI.”
自然翻成中文,就是用 AI 推动科学任务,再让科学任务反过来训练 AI。这个闭环听起来宏大,落到工程里其实很具体:任务要难,要靠搜索、代码、数值计算、模拟器或领域工具核验;答不出来、验不动、没有迁移收益的数据,会被筛掉。
分数好看,但口径要分清
BigBang-V1 的主张需要谨慎读。官方表格显示,它在选取的 35B 模型里拿到 8 个代表性 benchmark 的最高报告分数,并在 FrontierScience Research、Humanity’s Last Exam、PaperBench(Code-Dev)、BioMysteryBench-HD 上超过 DeepSeek V4 Pro Preview 这个 1.6T 级别对照。
几个具体数字能说明它的能力边界:
- BrowseComp 得分 76.5,低于 Gemini 3.1 Pro 的 85.9 和 GPT 5.5 的 84.4,但高于 Qwen3.6-35B-A3B 的 67.9;
- SWE-Bench Pro 得分 54.2,高于基座 Qwen3.6-35B-A3B 的 43.6,与 Gemini 3.1 Pro 的 54.2 持平;
- FrontierScience Research 得分 46.2,高于 DeepSeek V4 Pro Preview 的 40.7,也明显高于基座的 11.9;
- PaperBench(Code-Dev) 得分 53.6,高于 DeepSeek V4 Pro Preview 的 50.4 和基座的 30.7。
这些数字不能被读成“35B 全面打败 1.6T”。模型卡也标注了评测口径:BrowseComp、xbench、FrontierScience Research、HLE 使用仓库里的 general-agent runner;SWE-Bench Pro 和 SciCode-Verified 使用各自官方 harness。不同模型是否使用完全一致的运行环境、工具预算和搜索策略,仍会影响横向比较。
更稳妥的结论是:BigBang-V1 至少证明了一个方向,对可验证科研任务做数据层自进化,能把一个 35B-A3B 基座往长程搜索、代码和科研任务上明显推高。
核验链比口号更硬
“Recursive Self-Improving”很容易被讲成科幻故事。BigBang 这次的新闻价值在于把自我改进压到数据层,没有宣称模型已经能无限改造自身。
官方仓库描述了严格的评测防污染策略:在评测时拒绝直接搜索 Hugging Face,过滤 huggingface.co 和 hf.co 结果,禁止直接访问这些域名,也不会把参考答案暴露给 agent。仓库还给出 search、visit、code_exec 三类工具,单个轨迹最多 500 次工具调用。
这说明团队知道风险在哪里。若模型可以边搜索边答 benchmark,最怕的是把评测集、答案或相似材料带进上下文。BigBang 没有消除所有争议,但至少把评测管线、数据下载脚本和 harness 放出来,让外部研究者能继续拆。
这里也有一个容易忽略的限制:开源权重不等于完整复现。Hugging Face 模型卡、GitHub harness、技术报告能核验模型参数、上下文、榜单和工具策略,但训练数据生成过程、筛选日志、每轮外循环如何校准 Critic,并没有等同于完全开放。后续若要判断路线成色,要看第三方是否能用同类框架在新任务上复现增益。
中国团队押中了数据瓶颈
BigBang-V1 的产业位置也有意思。过去半年,顶级研究者频繁提到自动化科研和 recursive self-improvement。Jeff Dean 离职创业的 Discovery Loop、DeepMind 系研究者对自动化科学流程的关注,都在指向同一类瓶颈:人类专家出题、验题、写数据的速度,跟不上模型能力增长。
无尽前沿这支由上海交大、深势科技、上海算法创新研究院相关成员组成的团队,把入口选在 AI for Science,是一个务实选择。科学任务天然有大量工具链和可验证节点:代码能不能跑,数值能不能对,坐标能不能定位,论文复现是否通过测试。这比让模型凭主观偏好写“高质量回答”更容易形成训练信号。
对国内大模型生态来说,这比又一个聊天模型更有增量。算力、参数和价格战之外,训练数据怎么持续生产,已经变成底层能力。若 BigBang 路线能被复现,国产模型公司可以少一点追逐通用榜单的惯性,多一点面向可验证任务的工程闭环。
下一组可验证节点很清楚:第三方复测 BigBang-V1 的 benchmark;社区尝试用 SGLang、vLLM 或 KTransformers 跑满 262K 上下文;无尽前沿继续公开后续版本的数据管线变化;科研、代码和长程搜索之外,这套自进化合成方法能否迁移到企业流程、药物发现或机器人任务。
如果这些节点成立,BigBang 的意义就不止是一款开源模型。它会成为一个信号:当题库追不上模型时,下一代题库也开始由模型参与生产。
参考来源:量子位、Hugging Face 模型卡、CocoLoop、GitHub 仓库、Endless Frontier 技术报告;核验 BigBang-V1 参数规模、3B 激活参数、262K 上下文、约 10,000 条后训练样本、Benchmark 分数、评测 harness 与防污染策略。