卖点不是识别得准,是整理得干净
纯识别准确率这些年已经卷得差不多了,这一代的差异在后处理:它会主动删掉「呃」「那个」这类填充词,把说错又改口的部分按最终意图整理,认出专业术语和不常见拼写,并自动排版成能读的段落。也就是说交付物从「一串带时间戳的字」变成了「一份能直接看的记录」。 多语言那一侧是自动检测再转写,覆盖 85 种以上语言,也处理地区口音和方言,不需要事先指定语种。说话人分离目前的稳定支持是最多三位,超过三位标注为实验性——做会议记录的要注意这条边界。另外可以配置自定义词表,喂进产品名、人名、行业黑话这类默认识别不好的词。
两个 API,分别对应两种场景
模型走两条接口:Live API 用于实时流式、亚秒延迟;Interactions API 用于已录制音频,带说话人识别和词级时间戳。模型标识是 gemini-3.5-transcribe(批量音频)和 gemini-3.5-transcribe-live(实时流式),音频按 token 计费,和其他 Gemini 输入一个口径。 产品侧已经接进了安卓 Gboard 的 Rambler 和 macOS 版 Gemini 应用,Chrome 支持随后跟上。有报道提到 96000 token 的上下文窗口,约合一小时会议音频。
数字怎么读
官方给的成绩是流式 4.0%、非流式 2.6% 的平均词错率,来源标注为 Artificial Analysis;在 FLEURS 基准的主要语言与地区变体上则是流式 5.50%、非流式 5.04%。两组数不一样,因为测的语料不同——引用时要带上是哪一套,不能混着说。这些都是厂商提供或引用的数字,目前没有独立复现。 对在选转写工具的团队,值得实测的不是这几个百分点,而是三件在真实场景里更致命的事:中英夹杂时会不会切错语种、专有名词进不进自定义词表就认不出、以及超过三个说话人时分离质量掉到什么程度。公开预览阶段接进去试的成本不高,但别拿基准分当选型结论。