OpenAI 工程博客:大规模低延迟语音的门道

1 查看

OpenAI 发了一篇工程向文章,讲它如何在大规模并发下把语音对话的延迟压到自然对话的水平,细节对做实时应用的人很有参考价值。

技术上的硬骨头

语音对话的及格线很苛刻:人对停顿的容忍在几百毫秒量级,超过一秒就觉得对方反应迟钝。文章拆了延迟的各个来源——音频传输、语音活动检测、模型推理、语音合成,每一段都得抠。最值得注意的方向是用端到端语音模型替代「转文字、想、再转语音」的三段式管线,省掉中间环节既降延迟,也保住了语气信息。再叠加流式处理和推理调度的优化,才把整条链路压进体感自然的范围。

真实的成本结构

抛开宣传成分,这类工程博客的价值在于露了底:低延迟语音吃的是跟文本完全不同的资源——长连接、实时调度、为峰值预留的容量,每一项都贵。这也解释了语音功能为什么普遍定价偏高,以及创业公司的机会和陷阱在哪:做一个演示级的语音应用很容易,把延迟和成本同时压住才难。做语音交互的团队,可以拿它对照自家架构看一遍。

via: Hacker News