值得记的是分工,不是那 0.3 分
传播里最容易被截出来的是 BrowseComp 上 92.5 对 92.2——领先前沿模型 0.3 分。这个数字不必当真:它是单项基准,官方自己的表里 16 项只在五项上最高,其余是「有竞争力」而不是压倒。0.3 分的差距在任何一次重跑里都可能翻转。 真正有信息量的是分工。基座模型 GLM-5.2 是 Z.ai 的(744B MoE,MIT 许可),上海人工智能实验室做的是在它之上的后训练。也就是说这是一个「不训基座、专做 agentic 后训练」的成果——和本站 9 月 13 日写过的 Cognition SWE-2 是同一种路线,那一个是在 Moonshot 的 Kimi K3 上后训练。 两件事连起来说明一个正在成形的分工:**有人把大基座开放出来,另一些团队在上面做专门方向的后训练,各自署名、各自迭代。**这对没有基座训练能力的团队是好消息,前提仍然是你得有可执行的评测环境和 RL 工程能力。
Verifiable Experience Pipeline 这个名字说清了它想解决什么
技术路线上最该看的是那条管线:把工具中介的推理绑定到**可执行环境**和**外部校验的结果**上。翻译一下,就是训练信号不来自「答案看起来对不对」,而来自「跑一遍、外部检查器说对不对」。 这个方向针对的正是本站最近反复写到的那个坑。9 月 15 日那篇 DeepMind 百 agent 实验里,评分器只做静态关键词黑名单、字节级模板检查和编译通过,结果被记号技巧骗过;9 月 7 日写 IFM 时引过一份审计,五个终端 agent 基准的 1968 个任务里有 16% 能仅凭任务描述被钻空子。把验证放进可执行环境,是目前公开路线里对这个问题最直接的回应——当然,它同样只能做到「执行层面可验证」,语义层面的空子仍需另想办法。 模型卡里那句框架性表述也值得抄:agent 经常提出方法并实施修改,而人类保留大部分最终决定、用判断和反馈引导探索;作者把这称作「从任务级执行转向项目级协作」。这比「全自动」的说法诚实得多。
想上手要先确认三件事
第一是规格口径不一致:上下文窗口有资料写 256K,也有写 100 万 token 的,装之前以模型卡和实际配置为准。 第二是硬件门槛。约 1.5TB 开放权重、744B 的 MoE 基座,这不是单机能随便跑起来的东西;FP8 检查点降低了一些门槛,但认真自建仍然需要多卡节点。官方给了 SGLang 和 vLLM 的本地部署路径,也提供了面向国际与中国区的托管 API,想先评估的人走 API 更省事。 第三是所有分数目前都是官方自测。16 项基准的表格出自实验室自己的技术报告,尚无独立复现。按本站惯例,这属于厂商口径——尤其那五项「最高」,等第三方跑过再下结论。 最后一句关于发布方式:先放权重和模型卡、几天后补技术报告,这种顺序在开放权重圈越来越常见。对使用者是好事(能先跑起来),对判断是坏事(没有方法说明时无从评估)。这次两样都有了,可以开始认真测。
via: Hugging Face: internlm/Atria-Dawn-Preview、Pandaily 报道、Hugging Face: zai-org/GLM-5.2、llm-stats 的模型页