模型本身
Reflection 是 2024 年由两位前 Google DeepMind 研究员创办的美国公司,此前融资约 47 亿美元。10 月 5 日,它发布了首个开放权重模型 Beam:稀疏混合专家架构,总参数 5010 亿,每次激活 230 亿;在 23.8 万亿 token 上预训练,训练上下文 256K,有效长度扩展到 100 万 token。官方披露的训练算力是:预训练用 6144 块英伟达 GB300、不到四周;强化学习用约 1.05 万块 GB300、四周,生成超过 1 亿条 rollout。
但现在还下载不到。权重计划本月晚些时候以 Apache 2.0 许可证发布,附技术报告、模型卡和微调工具;目前仍在做最终红队测试和评估,只开放提前体验报名。训练数据和完整训练流程不在开放范围内。
成绩要看全
Reflection 公布的成绩里,SWE-Bench Verified 80.9%、AIME 2026 97.8%。但在同一张表上,它并不领先:DeepSWE v1.1 是 44.4%,Kimi K3 是 68.0%、Qwen 3.8 Max 是 51.0%;Terminal Bench v2.1 是 80.1%,低于 Kimi K3 的 88.3%;GPQA Diamond 90.5%,也是表中最低。Reflection 自己也承认,Kimi K3 这样的前沿开放模型在原始能力上仍然领先,Beam 的卖点是推理效率:在高级推理基准上与 GLM 5.2 相当,推理计算量少 3–4 倍。这个估算不含预填充、与上下文相关的注意力计算和服务开销,只是近似比较,不是实测成本。
影响判断
开放权重的第一梯队目前由中国团队的模型占据,Beam 是美国公司少有的同量级 Apache 2.0 选项,对有数据合规或供应商来源要求的企业有现实意义。不过在权重真正放出、第三方复现之前,所有数字都是厂商自测。打算用它做代码 agent 的团队要特别留意 DeepSWE 上的差距,到时用自己的任务实测再定。