分数追上了 Opus,价格只有一半
先看官方数字里最显眼的一组:在 agent 编程评测 Terminal-Bench 4.0 上,Sonnet 5.5 是 70.6%,Opus 5.5 是 66.4%;在覆盖 44 种职业的 GDPval-AA 上,两者是 1844 对 1846;在电脑操作评测 OSWorld 2.1 上是 80.1% 对 81.8%。 Opus 5.5 目前的价格是每百万 token 输入 4 美元、输出 20 美元,Sonnet 5.5 是 2 美元和 10 美元。**在这几项上,半价的模型追平甚至超过了旗舰。**差距更大的是 FrontierCode 1.1(46.2% 对 54.4%),也就是更难的代码任务上 Opus 仍明显领先。这与官方的分工说法一致:边界清楚的活给 Sonnet,要判断的活给 Opus。
「便宜最多 30%」取决于你开哪一档
价格没变,官方说的省钱来自「用更少的 token 干完同样的活」。这句话有条件:它说的是「多数工作」「最多」30%。 Artificial Analysis 的独立测试给了另一面。**在最高推理档位下,Sonnet 5.5 跑完它的智能指数一共输出了 4.1 亿 token,单任务平均成本 7.60 美元,比 Sonnet 5 最高档位的 5.09 美元高约 50%。**分数也确实更高(56 分,只比 Opus 5.5 低 2 分),但它是用更多 token 换来的。换到高档位,分数降到 47,单任务成本只有 1.08 美元。 两边的数字并不矛盾:官方比较的是日常任务,第三方测的是一套偏难的评测在最高档位下的表现。**对使用者来说,结论是「省不省钱」主要由你选的推理档位决定,而不是由模型名字决定。**
网络安全防护第一次下放到 Sonnet
另一个变化是安全策略。Sonnet 5.5 是第一个上线就带有与 Opus 5.5 相近网络安全防护的 Sonnet 模型,较高风险的网络安全任务会明显回退到 Sonnet 5 处理,需要完整能力的安全团队可以申请网络安全验证计划。官方同时提到新增了防止推理过程被提取的分类器,思考内容与创建它的账号绑定。 这意味着做安全研究的用户可能会碰到回退或拒绝,需要提前走验证流程。
对读者的实用含义
- 已经在用 Sonnet 5 的,可以直接换 ID 试,价格不变。 - 如果按用量付费,先在高档位或默认档位上跑自己的真实任务,看 token 用量,不要直接开最高档。 - 如果目前主要用 Opus 5.5 做代码 agent,Terminal-Bench 这类任务值得用 Sonnet 5.5 对比一轮,可能省一半钱。 边界说明:官方基准为 Anthropic 自测;Artificial Analysis 的成本数据基于其自有评测组合,不等于你的实际任务成本。