Reflection AI 发布了第一款开源权重模型 Beam。这是一个稀疏混合专家(MoE)模型,总参数 5010 亿,每个 token 激活 230 亿,主打编程、推理和智能体任务。公司说权重、技术报告和模型卡会在本月晚些时候发布,许可证用 Apache 2.0;模型目前还在做最后一轮红队测试和评估,开发者可以先在 platform.reflection.ai 申请抢先体验。
Reflection 由前 DeepMind 研究员创办,此前在隐身状态下做了一年多。今年 6 月它向 SpaceX 订了总额约 63 亿美元的算力,每月约 1.5 亿美元。
怎么训出来的
按官方博客的说法,Beam 共 52 层,中期训练把上下文扩到了 100 万 token。预训练用了 23.8 万亿 token,来源包括公开网页和授权数据集;原始网页 token 经过分级过滤,约 95% 被丢掉。
算力方面,预训练在 6144 块英伟达 GB300 上跑了不到四周;之后的强化学习阶段换到 1.05 万块 GB300,又跑了四周,生成超过 1 亿条 rollout,动用了约 13 亿个沙箱环境。Reflection 对这次强化学习的规模相当自信:
“We believe this is one of the largest scale RL runs conducted by any open lab to date.”
意思是,他们认为这是迄今开放实验室做过的最大规模强化学习之一。博客还提到,强化学习算力往上加,各项能力一路跟着涨,“看不到平台期”。
和中国开源模型放在一起看
Reflection 的对标对象几乎全是中国模型,这一点很直白。官方给出的对比表里,Beam 和智谱 GLM 5.2 打得有来有回,同时声称推理算力只用了对方的三分之一到四分之一;在编程和智能体任务上,它说自己接近参数量超过 2 万亿的 Qwen 3.8-Max。
挑几项看:
| 基准 | Beam | 表内对比 |
|---|---|---|
| SWE-bench Verified | 80.9 | Inkling 77.6 |
| Terminal Bench v2.1 | 80.1 | DeepSeek V4.1 Flash 90.6 |
| SWE Bench Pro v2-Hard | 77.2 | Kimi K3 88.2 |
| BrowseComp(带上下文) | 77.4 | Kimi K3 91.2 |
| GPQA Diamond | 90.5 | Kimi K3 93.5 |
这张表里 Beam 赢的项目不多。在终端操作、高难度软件工程和网页搜索上,Kimi K3 和 DeepSeek V4.1 Flash 都领先十个点上下。Reflection 主打的卖点是效率:激活参数 230 亿,在同档分数里算小的,部署成本会低一截。
海外媒体的叙事是“美国创业公司第一次做出能和中国头部开源模型正面比的模型”。过去一年多,开源权重榜单的前排基本被 DeepSeek、Qwen、Kimi、GLM 占着,美国这边 Meta 把重心转向闭源的 Muse 系列之后,能拿得出手的大尺寸开源模型很少。Beam 补的是这个位置。
还没回答的几件事
上面所有分数都来自 Reflection 自己的评测,测试设置、采样次数这些细节要等技术报告。权重还没有放出,社区没法独立跑分。
博客没有提供任何 API 定价,也没说会在哪些推理平台首发,只提到会和“生态分发伙伴”合作。对国内开发者来说,Apache 2.0 许可证意味着权重放出后可以自由商用和微调,不过 5010 亿参数的完整权重对显存的要求不低,多数团队大概率还是要等量化版本或第三方托管。
参考来源:Reflection AI 官方博客、Latent Space、CocoLoop、SiliconANGLE;参数规模、训练算力与各项基准分数均以 Reflection 官方博客公布数据为准。