阶跃发布全新语音大模型 StepAudio 3系列:覆盖语音识别、生成、实时交互与音乐创作
9月15日,阶跃发布StepAudio 3系列语音大模型,一次推出Realtime、ASR、TTS、Gen和Music五款模型,覆盖实时交互、语音识别、语音生成与音乐创作。多款模型在Artificial Analysis榜单排名全球第一。其中Realtime支持原生全双工对话,可处理打断与连续反馈,综合得分98.9%居首,并支持语音推理与任务异步执行;ASR词错误率为1.7%,并列全球第一,支持方言、中英混说及专业场景。TTS采用流式架构,可生成笑声、迟疑等副语言表现。Gen整合人声、音效与环境声,支持自然语言描述一次生成完整音频。Music支持清唱配乐、翻唱及多轮交互创作。五款模型均已上线阶跃星辰开放平台。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
