Claude Haiku 5.5 发布:10 万 token 以内每百万输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜九成,首次支持可调推理强度

Anthropic 于 10 月 7 日发布 Claude Haiku 5.5(模型 ID claude-haiku-5-5),在 API 及 AWS、Google Cloud、Microsoft Azure 上提供。价格按提示长度分档:10 万 token 以内每百万输入 0.10 美元、输出 0.50 美元,超过 10 万 token 为 0.50 美元和 2.50 美元;相比 Haiku 4.5 的 1 美元和 5 美元,10 万以内便宜 90%,以上便宜 50%,官方称平均约便宜 75%,但新分词器会让单任务 token 数略增。它是首个支持 Low 到 Max 五档推理强度的 Haiku 模型,官方称是 Anthropic 标准速度下最快的模型。官方基准中,OSWorld 2.1 离线子集为 72.4%(Haiku 4.5 为 15.7%),Terminal-Bench 4.0 为 39.2%,低于 Sonnet 5.5 的 70.6%。同时 Sonnet 5.5 缓存读取价格减半。

价格是最大的变化

10 月 7 日,Anthropic 发布 Claude Haiku 5.5,API 模型 ID 为 claude-haiku-5-5,同步上架 AWS、Google Cloud 和 Microsoft Azure。定价按提示长度分两档:

  • 10 万 token 以内:每百万输入 0.10 美元、输出 0.50 美元,缓存读取 0.01 美元;
  • 超过 10 万 token:输入 0.50 美元、输出 2.50 美元。

上一代 Haiku 4.5 是 1 美元和 5 美元,所以短提示便宜 90%,长提示便宜 50%,官方称平均约便宜 75%。需要留意的是,新分词器会让同样的任务多用一些 token,实际节省会比标价差略小。

它也是第一个支持可调推理强度的 Haiku,从 Low、Med、High、Xhigh 到 Max 五档。官方称它是 Anthropic 迄今标准速度下最快的模型(不含 Opus 的 Fast Mode);客户 Asana 报告延迟降低 30% 以上,Box 称延迟约为 Haiku 4.5 的一半。

能力在哪一档

官方基准里,它相对 Haiku 4.5 是跨代提升:OSWorld 2.1 离线子集 72.4% 对 15.7%,Terminal-Bench 4.0 39.2% 对 0%。和自家 Sonnet 5.5 比仍差一截:Terminal-Bench 4.0 是 39.2% 对 70.6%,OSWorld 是 72.4% 对 83.9%。和 OpenAI 的轻量模型 GPT-6 Luna 比,它在官方表格的各项里都更高,例如 OSWorld 72.4% 对 48.9%。

Anthropic 给它的定位很明确:摘要、上下文压缩、数据库查询、分类和子 agent 这类量大、对成本敏感的活;复杂的 agent 编程仍推荐 Sonnet 5.5 和 Opus 5.5。

影响判断

对已经在用 Haiku 4.5 跑分类、路由或摘要流水线的团队,这几乎是「换个模型名就降本」,值得尽快在自己的数据上做一轮回归测试,重点看分词器变化后的实际 token 账单。同一天 Sonnet 5.5 的缓存读取价格从 0.20 美元降到 0.10 美元,官方称多数 agent 工作因此便宜约 20%。主 agent 用 Sonnet、子任务交给 Haiku 5.5 的分工,成本会明显下来。所有基准与客户数据均为 Anthropic 发布口径。

via: Anthropic 官方发布页