9月17日·星期四 15:33·来源:InfoQ

边说话边推理、边聊天边调用工具,谷歌 Gemini 3.8 Live 要攻克语音 Agent 的沉默时刻

谷歌发布Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,已通过Gemini API和Google AI Studio向开发者开放。两款模型均支持文字、图像、音频和视频输入,输入上限131072 Token,支持函数调用,但未将代码执行、文件搜索或结构化输出列为支持能力。前者侧重低延迟与规模化部署,后者增加后台推理和异步工具调用能力,可在执行任务时先给出语音回应并报告进度,思考深度分低、中、高三级。开发者需依据Live API返回的IN_PROGRESS和IDLE状态判断任务是否完成。评测方面,Extended Thinking High配置在Artificial Analysis语音到语音榜单获82.6综合指数,τ-Voice Agent任务测试68.6%,Big Bench Audio语音推理97.7%。定价为音频输入约0.005美元/分钟,输出约0.018美元/分钟。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→