会懂网AI资讯,9月5日,微软于9月3日宣布推出MAI-Transcribe-2,宣称是其最快、最准确、最便宜的AI语音转文字模型。该模型在FLEURS多语种基准上平均词错误率低至5.2%,并定下每音频小时0.10美元的限时优惠价,活动持续至2026年底。

在性能上,MAI-Transcribe-2支持60种语言,并在FLEURS测试中平均词错误率均为5.2%,优于Gemini 3.1 Pro与GPT-Transcribe等主流模型。微软援引Artificial Analysis评测称,其速度比GPT-Transcribe快10倍、比ElevenLabs的Scribe v2快7倍、比Gemini 3.5 Transcribe快5倍。
功能层面,新模型新增说话人分离(diarization),可在一段录音内区分不同发言者并将文字归属到对应说话人;提供逐词时间戳,便于检索、导航与字幕对齐。它还支持关键词偏置、自动语言识别、语言切换与噪声环境下的转写。
转写风格可配置:verbatim模式完整保留语气词与口误,面向合规与分析;clean模式过滤冗余语气词,输出更易读的字幕、笔记与发布文本。这些能力让其在临床记录、法律文档、字幕与无障碍等场景中具备实用价值。
在可用性上,MAI-Transcribe-2已在Azure Speech以公开预览形式上线,开发者可通过Microsoft Foundry、MAI Playground与OpenRouter调用或试用。不过官方提示其尚属预览、无SLA、不建议用于生产负载。
会懂网观察,语音转写是大模型最贴近落地的能力之一。微软以”又快又便宜”的ASR模型切入,既补上了自家多模态矩阵中的语音短板,也向Whisper、Gemini等对手发起正面价格战,AI语音基础设施的竞争正愈发激烈。





















暂无评论内容