谷歌发布 Gemini 3.5 Transcribe:85 种语言自动识别,还会替你删掉「呃」和说错又改口的部分

谷歌 8 月 27 日发布语音转文字模型 Gemini 3.5 Transcribe,接替此前的 Chirp 3。它能自动识别并转写 85 种以上语言,处理背景噪音、口头禅、说错改口和专业术语,并自动排版;预录音频可按时间戳区分最多三位说话人(三人以上为实验性)。官方引用 Artificial Analysis 的测量,流式平均词错率 4.0%、非流式 2.6%,最终转写耗时较 Chirp 3 降低 70%——这些是厂商提供的数字,尚无独立复现。目前在 Gemini API 和 AI Studio 面向开发者公开预览。

卖点不是识别得准,是整理得干净

纯识别准确率这些年已经卷得差不多了,这一代的差异在后处理:它会主动删掉「呃」「那个」这类填充词,把说错又改口的部分按最终意图整理,认出专业术语和不常见拼写,并自动排版成能读的段落。也就是说交付物从「一串带时间戳的字」变成了「一份能直接看的记录」。 多语言那一侧是自动检测再转写,覆盖 85 种以上语言,也处理地区口音和方言,不需要事先指定语种。说话人分离目前的稳定支持是最多三位,超过三位标注为实验性——做会议记录的要注意这条边界。另外可以配置自定义词表,喂进产品名、人名、行业黑话这类默认识别不好的词。

两个 API,分别对应两种场景

模型走两条接口:Live API 用于实时流式、亚秒延迟;Interactions API 用于已录制音频,带说话人识别和词级时间戳。模型标识是 gemini-3.5-transcribe(批量音频)和 gemini-3.5-transcribe-live(实时流式),音频按 token 计费,和其他 Gemini 输入一个口径。 产品侧已经接进了安卓 Gboard 的 Rambler 和 macOS 版 Gemini 应用,Chrome 支持随后跟上。有报道提到 96000 token 的上下文窗口,约合一小时会议音频。

数字怎么读

官方给的成绩是流式 4.0%、非流式 2.6% 的平均词错率,来源标注为 Artificial Analysis;在 FLEURS 基准的主要语言与地区变体上则是流式 5.50%、非流式 5.04%。两组数不一样,因为测的语料不同——引用时要带上是哪一套,不能混着说。这些都是厂商提供或引用的数字,目前没有独立复现。 对在选转写工具的团队,值得实测的不是这几个百分点,而是三件在真实场景里更致命的事:中英夹杂时会不会切错语种、专有名词进不进自定义词表就认不出、以及超过三个说话人时分离质量掉到什么程度。公开预览阶段接进去试的成本不高,但别拿基准分当选型结论。

via: Google 官方博客The Decoder9to5Google