综合分之外,逐项差异很大
官方评测表里 Grok 4.6 赢下的项目集中在知识工作与前端:GDPVal-AA v2 拿到 1753,高于 GPT-5.6 Sol Max 的 1728 和 Fable 5 Max 的 1741;AA-Briefcase 1577 也是三者最高;法律领域的 Harvey LAB 15.8%,把另两家的 2.5% 和 11.3% 甩开一截。落后的地方同样明确:DeepSWE v1.1 拿 65.9%,GPT-5.6 Sol 是 73%、Fable 5 是 70%;Terminal-Bench v3.0 只有 26%,另两家分别是 34.6% 和 34.1%。相对自家上一代的提升倒是实打实——Terminal-Bench 从 15.7% 提到 26%,DeepSWE 从 54% 提到 65.9%。
提升来自后训练,不是堆规模
按两家的说法,Grok 4.6 走了比 4.5 更长的补充训练:精选的模型生成推理数据、工程数据,加上改进过的优化器和训练配方,先垫出更强的基座,再进 SFT 和 RL。SFT 阶段的做法是用 Grok 4.5 重新生成轨迹,覆盖不同推理强度、不同 agent 框架以及 STEM、软件工程、知识工作等领域,并用模型化检查把有问题的轨迹筛掉。RL 阶段则铺开到内核优化、Web 开发、计算机辅助设计等具体环境。官方还提到在长轨迹上观察到模型开始自我检验,做完一步会先验证再往下走。
读这组数字要留意的地方
全部为厂商自测或自报,中立 harness 的第三方复现尚未出现。CursorBench 这一项还多一层结构性问题:Cursor 既是基准维护方,又和 xAI 联合训练模型。上一代发布时 Cursor 自己披露过,「Cursor 代码库的早期快照被意外纳入了 Grok 4.5 的训练」,因此它在 CursorBench 上占优,且「具体影响不明」;同时说明该数据已为后续模型移除,基准也做了较大改版,现在是 3.2 版。这次 4.6 在 CursorBench v3.2 上是 69.9%,仍低于 Fable 5 Max 的 70.5%。
影响判断
选型定位比较清楚:价格没动($2/$6 每百万 token,fast 变体翻倍),综合分进了第一梯队,长时程 agent、前端与交互产物、知识工作类任务是强项,首周在 Cursor 和 Grok Build 里还有双倍额度可以试。但如果主要工作是仓库级代码修复和终端环境操作,DeepSWE 与 Terminal-Bench 上 7–8 个点的差距还摆在那里,换不换应该用自己的真实任务跑一轮再定,别只看那个综合分。
via: xAI 官方公告 Introducing Grok 4.6、Cursor 同步发布的说明、Cursor 关于 Grok 4.5 与 CursorBench 的说明;核实于 2026-08-13