会懂网AI资讯,9月2日,Meta推出首个实时音频感知模型Muse Voice Transcribe,可在包含20余名说话者的录音中实时分离不同发言者,并支持超过1小时的长音频,以及中英文夹杂的自然语码切换。开发者通过Meta Model API即可调用,定价为每1000分钟音频3美元,约合每小时0.18美元。
该模型把流式自动语音识别、说话人分离与端点检测整合进同一流程。与传统”录完再转”不同,它边说边输出文字,延迟大幅降低,适合实时听写、会议记录与通话字幕。Meta称,截至9月1日,该模型已在Artificial Analysis流式语音转文本榜单登顶第一。

训练覆盖70余种语言,其中25种在发布时完成验证。为兼顾实时响应与识别准确,Meta引入名为”自适应延迟”的动态机制:对容易识别的语句更快提交,对术语密集或语境复杂的词则调用更多上下文音频。这种逐词决策,试图在”快”与”准”之间找到平衡。
从多人的圆桌论坛到跨国团队的语音留言,语音正成为AI系统的实时感知层。当转写足够便宜且足够准,会议、客服、访谈的记录成本将被大幅压低。Meta这次以定价和技术路径双重发力,给实时语音市场扔进了一个不容忽视的新变量。
但效率提升的另一面是隐私与合规的考验:长音频被实时转写,意味着会议、通话被持续数字化。企业如何在“提效”与“授权”之间划线,将成为落地前的必答题。技术跑通之后,规则必须跟上,否则便利可能反噬信任。
对开发者而言,关键在于可控:何时转写、数据存于何处、能否本地部署,将决定它能否走出Demo、进入企业核心流程。便宜只是入场券,信任才是护城河。





















暂无评论内容