谷歌推出智能体视频理解功能:提升 Gemini 模型视频分析准确率,大幅降本减耗
谷歌近日宣布,在Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite模型中推出智能体视频理解功能。该功能将模型核心推理与原生视频工具结合,可在视觉帧、音频和转录文本中动态搜索目标片段,而非按固定帧率静态读取。在标准基准测试中,该功能使分析成本最高降低66%,Token消耗量最高降低88%,准确率提升最高7%,长视频场景下效率优势尤为明显。该功能采用标准Gemini API Token定价,不另收费用。新能力包括亚秒级时刻检索、长视频精准查询、异常检测及动作与物体计数。目前该功能已在Google AI Studio和Gemini Enterprise Agent Platform的API中上线,支持视频上传和YouTube视频分析,开发者将处理模式设为“agentic”即可启用。谷歌计划将该功能推广至Gemini应用内所有Flash和Flash-Lite模型用户,并将在未来数月为YouTube“Ask YouTube”功能提供支持。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(IT之家)→
