Cognition 在 Kimi K3 上做后训练,做出一个和 Fable 5.1 差不到一分、便宜 64% 的编码模型
Cognition 于 9 月 10 日发布编码模型 SWE-2,从 Moonshot 的 2.8 万亿参数开放权重模型 Kimi K3 后训练而来。官方数字:FrontierCode 1.1 Main 得 50.0%,与 Fable 5.1 相差不到一分,但成本低 64%;DeepSWE 1.1 为 73.0%,Terminal-Bench 2.1 为 92.8%,相对 Kimi K3 原始成绩分别提升 5.8、4.5 和 4.5 个百分点。方法上最值得记的是 effort-level 训练:这是 Cognition 第一个带推理 effort 档位的模型,全部档位在同一次 RL 运行里训练,每档加一个线性成本惩罚,惩罚幅度按基座模型帕累托前沿的局部斜率调。效率侧的改善很具体——SWE-2 medium 在 FrontierCode 1.1 Main 上比上一代 SWE-1.7 分更高,同时少用 58% 的轮次、平均便宜 81%,第一次真正动手改代码的中位步数从 48 步降到 18 步。短板也在自家材料里:Terminal-Bench 4 只有 27.3%,而 GPT-6 Astra 是 57.9%。目前在 Devin Desktop 与 CLI 上可用,Pro / Max / Teams 订阅者免费一个月(至 10 月 10 日)。











