Reflection发布501B开源模型Beam

Reflection AI 发布了第一款开源权重模型 Beam。这是一个稀疏混合专家(MoE)模型,总参数 5010 亿,每个 token 激活 230 亿,主打编程、推理和智能体任务。公司说权重、技术报告和模型卡会在本月晚些时候发布,许可证用 Apache 2.0;模型目前还在做最后一轮红队测试和评估,开发者可以先在 platform.reflection.ai 申请抢先体验。

Reflection 由前 DeepMind 研究员创办,此前在隐身状态下做了一年多。今年 6 月它向 SpaceX 订了总额约 63 亿美元的算力,每月约 1.5 亿美元。

怎么训出来的

按官方博客的说法,Beam 共 52 层,中期训练把上下文扩到了 100 万 token。预训练用了 23.8 万亿 token,来源包括公开网页和授权数据集;原始网页 token 经过分级过滤,约 95% 被丢掉。

算力方面,预训练在 6144 块英伟达 GB300 上跑了不到四周;之后的强化学习阶段换到 1.05 万块 GB300,又跑了四周,生成超过 1 亿条 rollout,动用了约 13 亿个沙箱环境。Reflection 对这次强化学习的规模相当自信:

“We believe this is one of the largest scale RL runs conducted by any open lab to date.”

意思是,他们认为这是迄今开放实验室做过的最大规模强化学习之一。博客还提到,强化学习算力往上加,各项能力一路跟着涨,“看不到平台期”。

和中国开源模型放在一起看

Reflection 的对标对象几乎全是中国模型,这一点很直白。官方给出的对比表里,Beam 和智谱 GLM 5.2 打得有来有回,同时声称推理算力只用了对方的三分之一到四分之一;在编程和智能体任务上,它说自己接近参数量超过 2 万亿的 Qwen 3.8-Max。

挑几项看:

基准Beam表内对比
SWE-bench Verified80.9Inkling 77.6
Terminal Bench v2.180.1DeepSeek V4.1 Flash 90.6
SWE Bench Pro v2-Hard77.2Kimi K3 88.2
BrowseComp(带上下文)77.4Kimi K3 91.2
GPQA Diamond90.5Kimi K3 93.5

这张表里 Beam 赢的项目不多。在终端操作、高难度软件工程和网页搜索上,Kimi K3 和 DeepSeek V4.1 Flash 都领先十个点上下。Reflection 主打的卖点是效率:激活参数 230 亿,在同档分数里算小的,部署成本会低一截。

海外媒体的叙事是“美国创业公司第一次做出能和中国头部开源模型正面比的模型”。过去一年多,开源权重榜单的前排基本被 DeepSeek、Qwen、Kimi、GLM 占着,美国这边 Meta 把重心转向闭源的 Muse 系列之后,能拿得出手的大尺寸开源模型很少。Beam 补的是这个位置。

还没回答的几件事

上面所有分数都来自 Reflection 自己的评测,测试设置、采样次数这些细节要等技术报告。权重还没有放出,社区没法独立跑分。

博客没有提供任何 API 定价,也没说会在哪些推理平台首发,只提到会和“生态分发伙伴”合作。对国内开发者来说,Apache 2.0 许可证意味着权重放出后可以自由商用和微调,不过 5010 亿参数的完整权重对显存的要求不低,多数团队大概率还是要等量化版本或第三方托管。

参考来源:Reflection AI 官方博客、Latent Space、CocoLoop、SiliconANGLE;参数规模、训练算力与各项基准分数均以 Reflection 官方博客公布数据为准。