值得记的是这个组合方式,不是那个分数
SWE-2 自己不训基座。它拿的是 Moonshot 7 月放出的 Kimi K3——2.8 万亿参数的稀疏 MoE、100 万 token 上下文、当时最大的开放权重模型,而且已经为 agentic 编码做过大量 RL——然后在上面接着做自己的强化学习。本站写过 Kimi K3 的开放权重发布,这是那条线上第一个引人注意的下游商业产物。 Cognition 给的增量是「自己的 RL 在多个基准上还能加 5–6 分」。这个幅度本身不惊人,但它回答的问题很重要:开放权重的强基座放出来之后,后训练还剩多少空间?答案是有,而且够撑起一个产品。对没有能力也没必要训基座的团队,这条路线的可复制性比跑分更值得研究——前提是你有 RL 的工程能力和能用的评测环境,这两样都不便宜。
effort 档位和成本惩罚一起训,这个做法有意思
更技术的一处亮点是 effort-level 训练。常见做法是模型训好之后,在外面加一层路由去决定「这题要不要多想」。Cognition 的做法是把所有 effort 档位放进同一次 RL 运行里训,每档配一个线性成本惩罚,而惩罚幅度按基座模型帕累托前沿在那一点的局部斜率来定。 换句话说,「要不要多花算力」变成了模型内生的、已经按成本定过价的决策,而不是外部调度器的猜测。配套的效果也很具体:SWE-2 medium 比上一代分更高,却少 58% 的轮次、平均便宜 81%;第一次真正改代码的中位步数从 48 降到 18。Cognition 把这归因于「聚焦式探索」——上一代的问题恰恰是过度探索,用户反馈说它把简单任务想得太久。
选型之前要看清的三件事
第一,Terminal-Bench 4 上 27.3% 对 GPT-6 Astra 的 57.9%。这个差距在自家材料里,说明在更长、更接近真实终端操作的任务上它还不在同一档。 第二,「便宜 64%」指的是什么。Cognition 没有公布每 token 的 API 单价,也没有公布上下文窗口,没有 model card。所以这个 64% 是 Devin 里的用量口径,不是一个你能拿去和别家 per-token 价目表直接相除的数字。 第三,所有对比数字都是 Cognition 自测,目前没有独立复现。这不意味着数字不可信,而是说在第三方跑过之前,它属于厂商口径。 可用性上倒是没门槛:Devin Desktop 和 CLI 都有,Pro / Max / Teams 订阅者免费用一个月到 10 月 10 日,Devin Pro 标价每月 20 美元。想验证的人有一个月窗口去跑自己的真实任务——这比看哪张表都管用。
via: Cognition《Introducing SWE-2》、Kimi K3 技术博客、MindStudio 基准与定价整理、CellCog 对 64% 成本口径的核查