上海人工智能实验室放出 Atria Dawn Preview:MIT 许可、1.5TB 权重,基座不是自己的,加值全在后训练

上海人工智能实验室的 Atria Dawn Preview 在 9 月 11 日先把 Hugging Face 仓库放了出来(次日补上 FP8 检查点),当时没有博客、没有论文、没有定价和 API,只有一份写满的模型卡和约 1.5TB 开放权重;随后技术报告发布,作者超过 140 人。它的基座是外部的——Z.ai 的 744B 参数 MoE 模型 GLM-5.2——实验室的工作是在它之上做后训练,走一条叫 Verifiable Experience Pipeline 的路线,把工具中介的推理绑定到可执行环境和外部校验的结果上。定位是完成任务而不是回答问题:覆盖问题分析、方案设计、工具使用、代码实现、实验执行、结果分析和失败恢复的整个回路。官方给的 16 项基准里,它在五项上列表最高——AutomationBench 53.8、BrowseComp 92.5、DeepSearchQA 96.0、BFCL v4 77.0、CyberGym 86.5;其中 BrowseComp 的 92.5 对 GPT-5.6 Sol 的 92.2 和 Claude Opus 5 的 90.8,是单项而非总体排名。MIT 许可,instruct 与 FP8 两种检查点在 Hugging Face 和 ModelScope 上,可用 SGLang、vLLM 本地部署。

值得记的是分工,不是那 0.3 分

传播里最容易被截出来的是 BrowseComp 上 92.5 对 92.2——领先前沿模型 0.3 分。这个数字不必当真:它是单项基准,官方自己的表里 16 项只在五项上最高,其余是「有竞争力」而不是压倒。0.3 分的差距在任何一次重跑里都可能翻转。 真正有信息量的是分工。基座模型 GLM-5.2 是 Z.ai 的(744B MoE,MIT 许可),上海人工智能实验室做的是在它之上的后训练。也就是说这是一个「不训基座、专做 agentic 后训练」的成果——和本站 9 月 13 日写过的 Cognition SWE-2 是同一种路线,那一个是在 Moonshot 的 Kimi K3 上后训练。 两件事连起来说明一个正在成形的分工:**有人把大基座开放出来,另一些团队在上面做专门方向的后训练,各自署名、各自迭代。**这对没有基座训练能力的团队是好消息,前提仍然是你得有可执行的评测环境和 RL 工程能力。

Verifiable Experience Pipeline 这个名字说清了它想解决什么

技术路线上最该看的是那条管线:把工具中介的推理绑定到**可执行环境**和**外部校验的结果**上。翻译一下,就是训练信号不来自「答案看起来对不对」,而来自「跑一遍、外部检查器说对不对」。 这个方向针对的正是本站最近反复写到的那个坑。9 月 15 日那篇 DeepMind 百 agent 实验里,评分器只做静态关键词黑名单、字节级模板检查和编译通过,结果被记号技巧骗过;9 月 7 日写 IFM 时引过一份审计,五个终端 agent 基准的 1968 个任务里有 16% 能仅凭任务描述被钻空子。把验证放进可执行环境,是目前公开路线里对这个问题最直接的回应——当然,它同样只能做到「执行层面可验证」,语义层面的空子仍需另想办法。 模型卡里那句框架性表述也值得抄:agent 经常提出方法并实施修改,而人类保留大部分最终决定、用判断和反馈引导探索;作者把这称作「从任务级执行转向项目级协作」。这比「全自动」的说法诚实得多。

想上手要先确认三件事

第一是规格口径不一致:上下文窗口有资料写 256K,也有写 100 万 token 的,装之前以模型卡和实际配置为准。 第二是硬件门槛。约 1.5TB 开放权重、744B 的 MoE 基座,这不是单机能随便跑起来的东西;FP8 检查点降低了一些门槛,但认真自建仍然需要多卡节点。官方给了 SGLang 和 vLLM 的本地部署路径,也提供了面向国际与中国区的托管 API,想先评估的人走 API 更省事。 第三是所有分数目前都是官方自测。16 项基准的表格出自实验室自己的技术报告,尚无独立复现。按本站惯例,这属于厂商口径——尤其那五项「最高」,等第三方跑过再下结论。 最后一句关于发布方式:先放权重和模型卡、几天后补技术报告,这种顺序在开放权重圈越来越常见。对使用者是好事(能先跑起来),对判断是坏事(没有方法说明时无从评估)。这次两样都有了,可以开始认真测。

via: Hugging Face: internlm/Atria-Dawn-PreviewPandaily 报道Hugging Face: zai-org/GLM-5.2llm-stats 的模型页