降的不只是单价,还有拆开卖的部分
0.36 降到 0.10 是明面上的 72%,但更实际的变化是原来常要另算的功能这次都在基础价里:说话人分离、词级时间戳、关键词偏置(`phraseList.phrases`,给领域术语和专有名词做提示)、自动语种识别、句中换语言,以及两种转写风格——`verbatim` 保留「嗯」「啊」和说错改口,给合规和质检用;`clean` 删掉这些,直接出能发的字幕和纪要。 榜单数字全部来自厂商引用:FLEURS 上 60 种语言平均词错率 5.2%,微软称排第一;Artificial Analysis 的词错率榜上排第二。速度的三个倍数同样是官方引用第三方评测的说法,尚无独立复现。
两行小字比降价重要
一是这个价有期限。微软写的是限时到今年年底,明年按什么价收没有说。把 0.10 直接乘进 2027 年的预算表是危险的——按官方给的例子,一年 10 万小时的呼叫中心音频在这个价下是 1 万美元,回到上一代价位就是 3.6 万。 二是 Azure 文档上那段公开预览声明:无服务等级协议,部分能力可能受限,不建议用于生产负载。这两条合起来,它现在适合做评估和试点,不适合把已经跑着的转写链路整条切过来。 工程限制也要看清楚:单个音频文件小于 300MB,格式限 WAV / MP3 / FLAC;`locales` 只能强制指定一种语言,且官方建议除非确定自动识别不奏效否则别指定。语言表里有 `zh`(简体中文)和 `yue`(粤语),没有单独列繁体中文语系,做繁体的团队得自己测输出字形和用语。
对选型的实际影响
本站 8 月 27 日写过谷歌的 Gemini 3.5 Transcribe,这一个多月里语音转写这条线的报价掉得很快。对已经在自建 Whisper 的团队,现在要算的是一道很朴素的账:自己那张卡的电费、运维和排队时间,和 0.10 美元一小时比,还剩多少优势——尤其在说话人分离和词级时间戳都不用自己拼的前提下。 对做会议纪要、字幕、客服质检这类产品的人,更该盯的是明年 1 月那个没公布的价格。现在能做的是把评估做完、把接口封装好,别把商业模型建在一个明确写着「限时」的数字上。
via: Microsoft AI 官方发布、Microsoft Learn: MAI-Transcribe 文档、VentureBeat 报道