会懂网AI资讯获悉,谷歌发布新一代语音识别模型Gemini 3.5 Transcribe。这是一款专用的多模态语音处理引擎,流式词错率降至4.0%、非流式降至2.6%,支持85种以上语言和最多3人说话人识别,延迟较上一代下降70%,并针对口语中的停顿和填充词做了专门优化。该模型已集成进Gboard、Chrome与Google Workspace,覆盖Android 17与Workspace场景。
在成本层面,Gemini 3.5 Transcribe的ASR(自动语音识别)成本较上一代降低约75%,高吞吐、低延迟的实时上下文感知能力,使其在会议转录、语音输入、字幕生成等场景具备显著优势。谷歌选择将语音引擎集成到自有生态全家桶中,旨在通过”系统级嵌入”巩固其在端侧AI和办公场景的入口地位。
从技术演进看,语音识别正从”通用大模型附加能力”走向”专用引擎”。相比通用模型,专用语音引擎在准确率、延迟、成本上都有针对性优化。谷歌此次将语音能力深度整合进操作系统和应用,也反映出AI能力”下沉”到系统层的趋势——用户无需打开特定App,在任意输入框就能获得高质量语音转写。
业内分析认为,Gemini 3.5 Transcribe的发布,是大模型厂商在垂直能力上展开精细化竞争的信号。当通用对话能力趋于饱和,语音、视觉、编程等专用引擎的比拼将决定AI产品的体验上限。对于企业用户而言,语音识别成本的持续下降,也将推动更多语音交互场景的大规模落地。
语音技术正经历从”专用方案”到”通用能力”的再进化。谷歌将语音引擎集成进操作系统级产品,意味着低成本高质量语音能力将成为”标配”,将倒逼专业语音厂商向更深度行业场景转型,也让更多语音交互应用成为可能。






























暂无评论内容