xAI 与 Cursor 联合发布 Grok 4.6:综合分追平 GPT-5.6 Sol,但两项硬核 agent 基准仍差 7–8 个点

8 月 12 日,xAI 与 Cursor 同步发布 Grok 4.6,主打长时程 agent 与交互、视觉类产物。官方数据里它在 Artificial Analysis 智能指数(九项基准的综合分)拿到 61,追平 GPT-5.6 Sol Max、略低于 Fable 5 Max 的 62。但逐项拆开看,DeepSWE 和 Terminal-Bench 这两项仍明显落后。定价维持 $2/$6 每百万 token,当天在 Cursor、Grok Build、xAI API 及 OpenRouter、Vercel、Cloudflare 上线。

综合分之外,逐项差异很大

官方评测表里 Grok 4.6 赢下的项目集中在知识工作与前端:GDPVal-AA v2 拿到 1753,高于 GPT-5.6 Sol Max 的 1728 和 Fable 5 Max 的 1741;AA-Briefcase 1577 也是三者最高;法律领域的 Harvey LAB 15.8%,把另两家的 2.5% 和 11.3% 甩开一截。落后的地方同样明确:DeepSWE v1.1 拿 65.9%,GPT-5.6 Sol 是 73%、Fable 5 是 70%;Terminal-Bench v3.0 只有 26%,另两家分别是 34.6% 和 34.1%。相对自家上一代的提升倒是实打实——Terminal-Bench 从 15.7% 提到 26%,DeepSWE 从 54% 提到 65.9%。

提升来自后训练,不是堆规模

按两家的说法,Grok 4.6 走了比 4.5 更长的补充训练:精选的模型生成推理数据、工程数据,加上改进过的优化器和训练配方,先垫出更强的基座,再进 SFT 和 RL。SFT 阶段的做法是用 Grok 4.5 重新生成轨迹,覆盖不同推理强度、不同 agent 框架以及 STEM、软件工程、知识工作等领域,并用模型化检查把有问题的轨迹筛掉。RL 阶段则铺开到内核优化、Web 开发、计算机辅助设计等具体环境。官方还提到在长轨迹上观察到模型开始自我检验,做完一步会先验证再往下走。

读这组数字要留意的地方

全部为厂商自测或自报,中立 harness 的第三方复现尚未出现。CursorBench 这一项还多一层结构性问题:Cursor 既是基准维护方,又和 xAI 联合训练模型。上一代发布时 Cursor 自己披露过,「Cursor 代码库的早期快照被意外纳入了 Grok 4.5 的训练」,因此它在 CursorBench 上占优,且「具体影响不明」;同时说明该数据已为后续模型移除,基准也做了较大改版,现在是 3.2 版。这次 4.6 在 CursorBench v3.2 上是 69.9%,仍低于 Fable 5 Max 的 70.5%。

影响判断

选型定位比较清楚:价格没动($2/$6 每百万 token,fast 变体翻倍),综合分进了第一梯队,长时程 agent、前端与交互产物、知识工作类任务是强项,首周在 Cursor 和 Grok Build 里还有双倍额度可以试。但如果主要工作是仓库级代码修复和终端环境操作,DeepSWE 与 Terminal-Bench 上 7–8 个点的差距还摆在那里,换不换应该用自己的真实任务跑一轮再定,别只看那个综合分。

via: xAI 官方公告 Introducing Grok 4.6Cursor 同步发布的说明Cursor 关于 Grok 4.5 与 CursorBench 的说明;核实于 2026-08-13