差价的一半来自架构,不是补贴
每小时 1.38 美元对至少 3 美元,这个落差容易被读成价格战。但两边的结构本来就不一样,值得先分清。 GPT-Live-1 是全双工:它一边听一边说,而真正的推理和工具调用交给后端的前沿模型去做——这部分是另行计费的。所以它的「每分钟 0.05 美元」并不是一通电话的全部成本,复杂问题会再叠上后端模型的账。谷歌这两个是原生的语音到语音模型,推理在同一个模型里,后台调用 API、处理视觉输入和继续说话是同一套能力。 这意味着做成本估算时不能只比每分钟单价:**要按「一通典型对话」端到端算一遍,把后端推理和工具调用的账一起加进去。**对话越复杂,两种结构的差距就越偏离那张价目表。
质量的证据目前指向两个方向
Artificial Analysis 的语音到语音质量指数上,Extended Thinking 以 82.6 排第一,具体分项包括 τ-Voice 68.6%、Sierra 的 τ-Voice-banking 35.1%、Big Bench Audio 97.7%;同一指数上 GPT-Live-1 为 69.8,在 11 个被评模型中排第七。 但榜单之外还有一层。有分析指出 GPT-Live-1 凭借全双工在对话自然度上应该仍然更好,从演示听感上也是如此,并据此判断谷歌是拿质量换了价格。这两类证据不冲突——一个量的是任务完成度和音频理解,另一个是「听起来像不像在对话」。做客服质检和工具型语音 agent 的人更在意前者,做陪伴、销售或任何要留住人的场景更在意后者。 那个 35.1% 的 τ-Voice-banking 分数值得单独留意:它是这组数字里最低的一项,而银行场景恰恰是语音 agent 最常被寄望的落地方向之一。选型时别只看指数总分。
两条边界要在上生产前确认
第一,**模型稳定不等于链路稳定**。这两个模型已经正式可用,但谷歌更大范围的 Live API 仍处于预览状态。也就是说你依赖的那条实时通路本身还在预览期,这对要签 SLA 的团队是个实际约束。 第二,官方自己写明的失败模式:模型卡说这两个模型可能产生幻觉,也可能偶发缓慢或超时。对语音场景,超时比在文本里严重得多——文本里用户会等,电话里三秒的空白就会被当成断线。要做的不是指望它不发生,而是先设计好兜底话术和转人工的触发条件。 还有一处口径分歧需要说明:有资料指出谷歌并未发布专门针对 3.8 Live 的独立价目表,上面那组每分钟单价是按 token 价格折算得来的。真要把成本写进预算,以你自己账单上的实际计费为准。
via: TechRepublic 报道、The Decoder 报道、MarkTechPost 技术解读、OpenAI: Introducing GPT-Live