Claude Sonnet 5.5 发布:官方说多数任务便宜最多 30%,第三方在最高推理档位测出单任务成本反而高约 50%

Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,这是 Claude 5.5 系列继 9 月 22 日的 Opus 5.5 之后的第二个模型,定位为 Opus 5.5 更快、更便宜的补充:Opus 5.5 面向需要审慎判断的复杂工作,Sonnet 5.5 擅长边界清楚的日常任务、修 bug 和制作文档、幻灯片与表格。官方称它比 Sonnet 5 快 30% 以上,完成同样工作通常需要少得多的 token,多数工作成本最多降低 30%。定价与 Sonnet 5 相同:每百万输入 token 2 美元、输出 10 美元、缓存读取 0.2 美元、缓存写入 2.5 美元;模型 ID 为 claude-sonnet-5-5,可通过 Claude 平台及 AWS、Google Cloud、Microsoft Azure 使用。官方基准中,Terminal-Bench 4.0 为 70.6%(Sonnet 5 为 10.3%,Opus 5.5 为 66.4%),OSWorld 2.1 为 80.1%(Opus 5.5 为 81.8%),GDPval-AA v2.1 为 1844(Opus 5.5 为 1846)。它是第一个上线即带有与 Opus 5.5 相近网络安全防护的 Sonnet 模型,较高风险的网络安全任务会明显回退到 Sonnet 5,通过网络安全验证计划可获得更多能力。第三方评测机构 Artificial Analysis 的测试显示:最高推理档位下它在其智能指数上得 56 分,但完成指数评测共输出 4.1 亿 token,单任务平均成本 7.60 美元,比 Sonnet 5 最高档位的 5.09 美元高约 50%;高档位下得 47 分、单任务 1.08 美元。Haiku 5.5 将在未来几周加入该系列。

分数追上了 Opus,价格只有一半

先看官方数字里最显眼的一组:在 agent 编程评测 Terminal-Bench 4.0 上,Sonnet 5.5 是 70.6%,Opus 5.5 是 66.4%;在覆盖 44 种职业的 GDPval-AA 上,两者是 1844 对 1846;在电脑操作评测 OSWorld 2.1 上是 80.1% 对 81.8%。 Opus 5.5 目前的价格是每百万 token 输入 4 美元、输出 20 美元,Sonnet 5.5 是 2 美元和 10 美元。**在这几项上,半价的模型追平甚至超过了旗舰。**差距更大的是 FrontierCode 1.1(46.2% 对 54.4%),也就是更难的代码任务上 Opus 仍明显领先。这与官方的分工说法一致:边界清楚的活给 Sonnet,要判断的活给 Opus。

「便宜最多 30%」取决于你开哪一档

价格没变,官方说的省钱来自「用更少的 token 干完同样的活」。这句话有条件:它说的是「多数工作」「最多」30%。 Artificial Analysis 的独立测试给了另一面。**在最高推理档位下,Sonnet 5.5 跑完它的智能指数一共输出了 4.1 亿 token,单任务平均成本 7.60 美元,比 Sonnet 5 最高档位的 5.09 美元高约 50%。**分数也确实更高(56 分,只比 Opus 5.5 低 2 分),但它是用更多 token 换来的。换到高档位,分数降到 47,单任务成本只有 1.08 美元。 两边的数字并不矛盾:官方比较的是日常任务,第三方测的是一套偏难的评测在最高档位下的表现。**对使用者来说,结论是「省不省钱」主要由你选的推理档位决定,而不是由模型名字决定。**

网络安全防护第一次下放到 Sonnet

另一个变化是安全策略。Sonnet 5.5 是第一个上线就带有与 Opus 5.5 相近网络安全防护的 Sonnet 模型,较高风险的网络安全任务会明显回退到 Sonnet 5 处理,需要完整能力的安全团队可以申请网络安全验证计划。官方同时提到新增了防止推理过程被提取的分类器,思考内容与创建它的账号绑定。 这意味着做安全研究的用户可能会碰到回退或拒绝,需要提前走验证流程。

对读者的实用含义

- 已经在用 Sonnet 5 的,可以直接换 ID 试,价格不变。 - 如果按用量付费,先在高档位或默认档位上跑自己的真实任务,看 token 用量,不要直接开最高档。 - 如果目前主要用 Opus 5.5 做代码 agent,Terminal-Bench 这类任务值得用 Sonnet 5.5 对比一轮,可能省一半钱。 边界说明:官方基准为 Anthropic 自测;Artificial Analysis 的成本数据基于其自有评测组合,不等于你的实际任务成本。

via: Anthropic 官方发布页、Artificial Analysis 评测页、VentureBeat 报道