Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写
Meta发布首个实时音频感知AI模型Muse Voice Transcribe,开发者可通过Meta Model API调用,定价为每1000分钟音频3美元(约合每小时1.2元人民币)。该模型整合流式自动语音识别、说话人分离与端点检测,用户说话时系统同步输出文字,无需等待完整录音结束。它能在包含20余名说话者的录音中分离不同发言者,并自动识别说话结束边界。模型训练覆盖70余种语言,其中25种在发布时完成验证,支持超过1小时音频及句内句间自然语言切换,开发者可通过语言、关键词和上下文偏置提升特定场景识别效果。技术上,Meta引入自适应延迟机制,针对每个词动态调整接收额外音频的量,对易识别语音快速提交结果,对复杂词语调用更多上下文,兼顾实时性与准确度。Meta称,截至2026年9月1日,该模型位列Artificial Analysis流式语音转文本排行榜第一名。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(IT之家)→
