谷歌落后一个时代?CEO 亲自官宣“语音转文字”模型,网友:你们看不清形势啊
谷歌于8月26日发布语音转文本模型Gemini 3.5 Transcribe,CEO皮查伊在X平台官宣。该模型可自动清理语气词、口误并补充标点,支持85种以上语言及实时切换,针对嘈杂环境、多口音及专业词汇优化,并支持自定义词表(最多1000词)和最多8人说话人分离。据谷歌引用的测评数据,其流式转录词错误率为4.0%,非流式2.6%,延迟较上代Chirp 3缩短70%。提供实时与预录音频两个版本,价格分别为每分钟0.009美元和0.005美元。模型新增Smart Transcription功能,可将口语整理为成稿文本,但谷歌同时提供逐字记录模式以保留原始措辞。该技术已集成至Gboard和Gemini应用。部分用户批评谷歌在行业聚焦Agent与端到端交互时仍主推语音转写,认为其产品节奏与行业焦点错位。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
