我的订单|我的收藏|我的商城|帮助中心|返回首页
虚拟现实新闻>行业>新闻动态>行业动态

Meta实时语音模型支持20+说话人识别,进一步适配AI眼镜

文章来源:VR陀螺 作者:jack 发布时间:2026年09月09日 点击数: 字号:

近日,Meta发布实时音频感知模型Muse Voice Transcribe,这是Meta Superintelligence Labs推出的首个实时语音转写模型。该模型会将输入音频切分为80毫秒片段,并在每个片段结束时判断是继续等待上下文,还是立即输出下一段文字。

Meta表示,模型会根据不同词语的识别难度动态调整等待时间。对于较容易识别的内容,会更快完成输出;遇到更复杂的词语时,则会增加监听时间,以在识别准确率和转写延迟之间取得平衡。相关策略通过强化学习训练完成。

根据Artificial Analysis的独立测试,Muse Voice Transcribe英文单词错误率为3.1%,说话结束后的输出延迟约为0.16秒。相比之下,ElevenLabs Scribe v2 Realtime的错误率为3.6%、延迟约0.14秒,AssemblyAI Universal-3.5 Pro Realtime的错误率为4.0%。

除实时转写外,Muse Voice Transcribe还将说话人识别、说话人切换检测及语句边界判断整合在同一模型中。系统可同时区分20名以上说话人,并支持超过1小时的连续录音处理,无需后期处理。Meta还展示了8人在同一空间内交谈时,模型实时区分不同说话人的演示。

语言能力方面,Meta称该模型训练覆盖70多种语言,其中25种经过较为完整的测试,同时支持一段话中切换不同语言。开发者还可以提供语言、关键词及上下文提示,以提高专有名词等内容的识别准确率。

Meta此次发布也明显指向AI眼镜等持续在线的个人AI设备。公司在演示中强调,稳定的实时语音识别是个人AI Agent理解真实对话的重要基础,而说话人识别和长时间连续转写能力,也能够用于AI眼镜在多人交流环境下获取和处理语音信息。

目前,Meta AI和Muse Code中的语音输入功能已经采用Muse Voice Transcribe,开发者也可以通过Meta Model API调用该模型。Meta暂未公布其参数规模、训练数据量及具体音频来源,模型权重也未开放。

  • 暂无资料
  • 暂无资料
  • 暂无资料
  • 暂无资料
  • 暂无资料