🎯 科技 · AI应用
谷歌Gemini新增智能体视频理解功能,成本降66%、Token减少88%,长视频分析迈入自主决策时代
9月3日,谷歌宣布为Gemini 3.7 Flash、3.6 Flash及3.5 Flash-Lite三大模型新增智能体视频理解功能。这是视频AI分析领域的一次重要技术跃迁——模型不再只是"逐帧播放",而是拥有了自主检索、筛选、核验视频内容的智能体能力。
在传统的视频理解任务中,模型往往采用固定帧率读取(默认1FPS),开发者通过API调整参数来平衡Token开销与信息保留。但这种方式在长视频场景下存在天然缺陷:要么消耗海量Token却遗漏关键细节,要么为了省钱而牺牲分析深度。谷歌此次引入的智能体模式,彻底改变了这一范式。
一、从"被动读取"到"主动检索"谷歌介绍,智能体视频理解将模型的核心推理能力与原生视频工具相结合,能够动态地从视频视觉帧、音频和转录文本中自主检索、扫描、核验目标片段。这意味着模型可以根据任务需求,自主选择读取内容、调整播放速度,只提取任务所需的片段与信号,而非机械地处理全部帧数据。
基准测试数据显示,搭载该功能的Gemini模型最高可将视频分析成本降低66%,Token消耗量最高下降88%,分析准确率最高提升7%。这一组数据背后,是长视频处理场景的一次质变——过去需要开发者手动筛选的关键片段,现在由模型智能循环调用内部工具完成。
二、亚秒级检索与复杂内容分析谷歌强调,这项技术在长视频处理场景中优势尤为突出。具体来看,新能力支持亚秒级时刻检索,能精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,助力高精度自动化视频编辑;可对数小时的长视频开展复杂内容检索,而不消耗海量Token资源;还能针对指定时间窗口调高采样帧率,完成快速运动画面、细微视觉异常的检测,以及时序下重复动作、多类物体的精准计数。
目前,该功能已在Google AI Studio和Gemini企业智能体平台的API上线,支持本地视频上传与YouTube视频解析。开发者只需在接口配置中将处理模式设置为"agentic"即可开启。谷歌表示,Gemini API沿用标准Token计费规则,不额外收取功能使用费。按谷歌规划,该能力将逐步推送至全部Flash、Flash-Lite模型用户,未来数月还将赋能YouTube视频页面的"Ask YouTube"功能,让普通用户也能享受AI视频深度分析服务。
综合环球网、IT之家、财联社报道 | 2026年9月4日