语音 agent 的每小时成本被打到约 1.38 美元:谷歌发布 Gemini 3.8 Live,架构和 GPT-Live-1 走的是两条路

谷歌 DeepMind 于 9 月 15 日发布两个面向开发者的音频模型——Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,通过 Gemini API 和 AI Studio 提供。它们支持 97 种以上语言,能在后台发起 API 调用、处理视觉输入并同时保持说话;Extended Thinking 的定位是在模型做多步推理、后台跑工具时让对话继续下去。定价两者相同:音频输入每分钟 0.005 美元、输出每分钟 0.018 美元(按每百万 token 输入 3 美元、输出 12 美元折算),约合每小时 1.38 美元;对照 OpenAI 的 GPT-Live-1 每分钟 0.05 美元、每小时至少 3 美元。架构差异也值得注意:GPT-Live-1 是全双工语音模型,把推理和工具调用交给后端模型(推理与工具调用另行计费),而谷歌这两个是原生的语音到语音模型。在 Artificial Analysis 的语音到语音质量指数上,Extended Thinking 以 82.6 排第一。需要留意的边界:模型本身已稳定且正式可用,但谷歌更大范围的 Live API 仍处于预览;模型卡也写明可能出现幻觉、偶发缓慢或超时。

差价的一半来自架构,不是补贴

每小时 1.38 美元对至少 3 美元,这个落差容易被读成价格战。但两边的结构本来就不一样,值得先分清。 GPT-Live-1 是全双工:它一边听一边说,而真正的推理和工具调用交给后端的前沿模型去做——这部分是另行计费的。所以它的「每分钟 0.05 美元」并不是一通电话的全部成本,复杂问题会再叠上后端模型的账。谷歌这两个是原生的语音到语音模型,推理在同一个模型里,后台调用 API、处理视觉输入和继续说话是同一套能力。 这意味着做成本估算时不能只比每分钟单价:**要按「一通典型对话」端到端算一遍,把后端推理和工具调用的账一起加进去。**对话越复杂,两种结构的差距就越偏离那张价目表。

质量的证据目前指向两个方向

Artificial Analysis 的语音到语音质量指数上,Extended Thinking 以 82.6 排第一,具体分项包括 τ-Voice 68.6%、Sierra 的 τ-Voice-banking 35.1%、Big Bench Audio 97.7%;同一指数上 GPT-Live-1 为 69.8,在 11 个被评模型中排第七。 但榜单之外还有一层。有分析指出 GPT-Live-1 凭借全双工在对话自然度上应该仍然更好,从演示听感上也是如此,并据此判断谷歌是拿质量换了价格。这两类证据不冲突——一个量的是任务完成度和音频理解,另一个是「听起来像不像在对话」。做客服质检和工具型语音 agent 的人更在意前者,做陪伴、销售或任何要留住人的场景更在意后者。 那个 35.1% 的 τ-Voice-banking 分数值得单独留意:它是这组数字里最低的一项,而银行场景恰恰是语音 agent 最常被寄望的落地方向之一。选型时别只看指数总分。

两条边界要在上生产前确认

第一,**模型稳定不等于链路稳定**。这两个模型已经正式可用,但谷歌更大范围的 Live API 仍处于预览状态。也就是说你依赖的那条实时通路本身还在预览期,这对要签 SLA 的团队是个实际约束。 第二,官方自己写明的失败模式:模型卡说这两个模型可能产生幻觉,也可能偶发缓慢或超时。对语音场景,超时比在文本里严重得多——文本里用户会等,电话里三秒的空白就会被当成断线。要做的不是指望它不发生,而是先设计好兜底话术和转人工的触发条件。 还有一处口径分歧需要说明:有资料指出谷歌并未发布专门针对 3.8 Live 的独立价目表,上面那组每分钟单价是按 token 价格折算得来的。真要把成本写进预算,以你自己账单上的实际计费为准。

via: TechRepublic 报道The Decoder 报道MarkTechPost 技术解读OpenAI: Introducing GPT-Live