8月27日·星期四 11:03·来源:36氪

谷歌推出迄今“最精准”语音转文本模型,从“逐字记录”迈向“理解式转写”

谷歌发布新一代语音转文本模型,宣称其为迄今“最精准”版本。该模型突破传统逐字记录模式,转向“理解式转写”,能够结合上下文语义对语音内容进行智能处理。新模型在嘈杂环境识别、多说话人区分及专业术语转换等场景下表现显著提升,并支持更自然的标点与格式生成。此次升级旨在降低语音交互延迟,提升会议记录、字幕生成等应用效率。目前该模型已向开发者开放API接口,市场反馈显示其错误率较前代降低约30%。分析认为,此举将加剧AI语音赛道竞争,推动行业从单纯识别向深度语义理解转型。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(36氪)→