14 倍是拿什么做的分母
参照系是标准档约每秒 53 token 的推理基线,OpenAI 称提速不牺牲质量。它同时给了跨家对比:加速后的 Sol 比 Fable 5 快 11 倍、比 Fast 档的 Opus 4.8 快 5 倍。这些数字全部来自 OpenAI 与 Cerebras 自己,没有第三方复测;OpenAI 也写明延迟与成本估算来自离线模拟生产行为(计入工具调用与 token 量),实际结果可能差别很大。看这类公告时,把「最多 14 倍」理解成理想条件下的上限比较稳妥。
卖点是延迟,不是能力
OpenAI 把这档位对准延迟敏感的场景:金融研究、事故响应、客服、语音应用、电商和线上实验,早期测试方包括 Jane Street、Podium、Basis 和 Rogo。它自己内部也用在事故响应上——让模型读日志和调用链、总结会话、准备或验证修复方案。这类活儿的共同点是模型能力够用,卡点在人等结果的那几十秒,所以提速的边际收益比换更强的模型更高。
和现有 Fast 档、以及 Cerebras 协议的关系
Ultrafast 与已有的 Fast 档是两回事:Fast 按量计费,Sol 在该档最高快约 2.5 倍,价格是每百万 token 输入 10 美元、输出 60 美元,而标准档 Sol 是 5 / 30 美元。Ultrafast 目前没有价格,等于这一档的性价比还无法评估——想上生产的团队现在能做的只有排队申请,以及别把它写进已承诺的交付时间表。背景是今年 1 月 OpenAI 与 Cerebras 签下多年协议,计划到 2028 年分阶段部署最多 750 兆瓦的 Cerebras 推理系统,这次预览是那笔产能第一次落到具体产品档位上。
via: OpenAI 官方公告《Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed》、Cerebras 官方博客、9to5Mac 报道;核实于 2026-08-15