ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

501B 总参 / 23B 激活:Reflection Beam 把开源模型的竞争推到了 RL 算力这一层

501B 总参 / 23B 激活:Reflection Beam 把开源模型的竞争推到了 RL 算力这一层 501B 总参 / 23B 激活Reflection Beam 把开源模型的军备竞赛推到了 RL 算力这一层2026 年 10 月 5 日Reflection AI 发布了 Beam —— 他们的第一个开放权重模型。但有意思的是权重还没放出来。官方说技术报告、model card、开发者产物要本月晚些时候才发。也就是说我们现在能看到的是一份把训练工程写得非常细的公告而不是一个可以下载的模型。这篇文章就把这份公告里的工程细节拆开讲。一、它到底是个什么模型Beam 是一个**稀疏 MoEMixture-of-Experts**模型总参数 501B激活参数 23B官方给的定位是三类负载coding、reasoning、agentic23B 激活 / 501B 总参意味着它走的是大容量、稀疏调用的路线 —— 每个 token 只走一小部分专家。这也是它后面敢谈推理效率的前提推理成本看激活参数不看总参数。预训练用了23.8 万亿 token来源是网页数据加上授权licensed的私有数据集。二、真正的主角是 RL不是预训练这篇公告里最有信息量的部分是它把RL强化学习的规模写得很具体项数字GPU10.5K 张 NVIDIA GB300训练时长4 周生成的 rollout超过 1 亿个最大上下文256K token训练与评分用的 sandbox约 13 亿个为此采购的环境100 万个coding / agentic / STEM官方自己的评价是这可能是目前任何开源实验室做过的最大规模 RL 训练之一。而且他们给了一个趋势判断 ——能力随 RL 算力持续上升没有看到平台期。这句话比任何一个基准分数都值得注意。它意味着在 Beam 这条技术路线上继续加 RL 算力仍然能换到能力而不是撞到了天花板。三、工程难点异步 RL 下的策略陈旧这部分是全文技术含量最高的地方值得单独讲。Beam 用的是异步策略梯度asynchronous policy gradients。异步的好处是吞吐高 —— 不用等最慢的那条 rollout。但它带来一个规模化的副作用长 rollout 的 token 是由多个不同的模型 checkpoint 生成的。越早生成的 token相对于当前策略就越旧。这就叫policy staleness策略陈旧。更要命的是还有第二个来源训练引擎和推理引擎之间的数值不匹配。两者算出来的东西有微小差异在长 rollout 上会不断累积。两个问题叠在一起异步 RL 一放大就发散。Reflection 的解法是新算法他们说这套办法让完全异步的 RL 在规模化下保持稳定即使学习的是一天前生成的交互。官方给了一个很硬的自测数字1 天陈旧度 落后当前策略 107 个权重版本数值仍然稳定。“落后 107 个版本还能训”—— 这个数字说明他们的 staleness 容忍度做到了什么程度。做 RL 基础设施的人会知道这有多难。四、长度惩罚先变短再变长另一个有意思的细节是可控长度惩罚controllable length penalty奖励成功的解同时抑制不必要的 token。但训练过程出现了一个非单调的现象官方如实写了出来RL 早期性能上升的同时completion 长度下降—— 模型学会了用更少的推理把问题解出来RL 后期随着 agentic 能力增强长度重新变长—— 但这些多出来的 token支撑了进一步的性能提升。这个 U 型曲线值得琢磨它说明推理长度本身不是一个可以直接优化的目标。早期压长度是在去掉废话后期加长度是在做更复杂的事—— 两者都让模型变好但方向相反。所以一个只盯着输出 token 数来优化的策略可能在早期看着漂亮到后期反而压住了能力上限。五、官方自己承认它不是最强的这一点我觉得值得单独拎出来说因为很少见。官方原文明确写了Where frontier open models like Kimi K3 remain ahead on raw capability在原始能力上像 Kimi K3 这样的前沿开放模型仍然领先然后紧接着给出了 Beam 的定位优势在推理时的效率。官方给的具体口径是advanced reasoning 基准上达到GLM-5.2 可比的分数而只用 3–4 倍更少的推理算力与2T 参数级别的模型点名了 Qwen 3.8-Max相比每 token 需要的推理算力显著更少。官方把这件事总结成一句话“more intelligence per token”。“不自称最强、只说自己最划算”—— 这个定位选择本身就是一个信号开源模型的竞争维度已经从谁分高转向了谁每块钱买到更多智能。六、基准表要怎么读别读成Beam 最强官方放了一张 benchmark 表。但直接看结论会看错。基准BeamGLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 FlashDeepSWE v1.144.461.068.051.074.2SWE Bench Pro v2-Hard77.284.388.2NRNRSWE Bench Pro v165.5NRNR67.7NRTerminal Bench v2.180.188.288.386.690.6SWE Atlas Codebase QnA34.661.068.0NRNRSWEBench Multilingual78.0NRNRNRNRSWEBench Verified80.9NRNRNRNR三个必须注意的点Beam 只在两项上领先—— SWEBench Multilingual (78.0) 和 SWEBench Verified (80.9)。这两项上其他模型都没报分。在 DeepSWE v1.1 和 Terminal Bench v2.1 上DeepSeek V4.1 Flash 明显更高74.2 vs 44.490.6 vs 80.1。大量格子是NR官方标注 “not reported”未报告。这不是一次全模型同条件的横评—— 是一张把各家自报数字拼起来的表。所以正确读法是Beam 在部分 coding 基准上进了第一梯队但不存在全面领先这回事。官方自己也没这么说。七、省 3–4 倍算力这个数字的口径这个结论对应官方 Figure 2算法是明写的FLOPs ≈ 2 × 激活参数量 × 平均生成 token 数限定条件官方原文列的一条都不能省每次乘加算两次操作MoE 用每 token 激活的参数不用 501B 总量不含prompt prefill、依赖上下文的 attention 运算、服务开销别家模型的评测分数来自Artificial Analysis 和 DataCurve不是自己跑的官方原话这是近似算力比较approximate compute comparison不是实测推理成本。所以不要说实测省 3–4 倍成本。严谨的说法是在官方给定的估算口径下达到可比推理分数所需的生成侧 FLOPs 少 3–4 倍。真实成本还取决于你部署在哪、batch 多大、prefill 占多少 —— 这些这张图里都没有。八、现在能做什么不能做什么能做的在 https://platform.reflection.ai/登记早期访问把这份公告当作一份RL 基础设施的工程案例来读 —— 10.5K GB300、1 亿 rollout、13 亿 sandbox、107 版本陈旧度这些数字本身就说明了 2026 年做前沿 RL 的门槛在哪。还不能做的下载权重官方明说权重、技术报告、model card、开发者产物都是本月晚些时候发布评估许可证还没公布算部署成本显存占用、硬件门槛都没给看第三方复现权重没放任何实测都不存在。官方还提到 Beam正在做最后的 red-teaming 和评估—— 这也解释了为什么先发公告、后放权重。小结把 Beam 这条新闻的价值浓缩成三句话开源模型的竞争维度正在从参数量/榜单分转向每 token 的智能密度—— Beam 官方自己承认原始能力不如 Kimi K3但把省 3–4 倍推理算力当成核心卖点来讲。RL 已经成为和预训练并列的独立 scaling 轴—— 10.5K 张 GB300、4 周、1 亿 rollout、13 亿 sandbox这套基础设施的规模本身就是门槛。异步 RL 的策略陈旧是可以被工程手段压住的—— 落后 107 个权重版本仍能稳定训练这个数字对做 RL infra 的人有直接参考价值。至于模型本身好不好用 ——得等权重放出来才算数。参考资料内容来源页面日期核验时间全部模型事实、RL 规模、基准表、效率口径Introducing Beam: Reflection’s 501B open-weight modelReflection 官方博客2026-10-052026-10-07第三方报道仅用于交叉确认发布日期与参数量Reflection AI debuts open-source Beam model with 501B parametersSiliconANGLE2026-10-052026-10-07标签人工智能/机器学习、AIGC/语言模型摘要≤256 字Reflection AI 于 2026-10-05 发布首个开放权重模型 Beam501B 总参 / 23B 激活的稀疏 MoE面向 coding、reasoning、agentic。本文逐条拆解官方公告里的工程细节 —— 23.8 万亿 token 预训练、10.5K 张 NVIDIA GB300 跑 4 周产出 1 亿 rollout、256K 上下文、约 13 亿 sandbox重点讲异步 RL 的「策略陈旧」问题与官方解法落后 107 个权重版本仍稳定以及长度惩罚带来的「先变短再变长」非单调曲线。同时说明官方基准表的正确读法多项为 NR并非全面领先与「省 3–4 倍算力」的估算口径。权重与技术报告官方称本月晚些时候发布。
返回列表