🎯 科技 · AI
一、谷歌推出革命性视频理解功能谷歌Gemini新增智能体视频理解功能,分析成本最高降66%
9月3日,谷歌宣布为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash‑Lite模型新增智能体视频理解功能。这项新功能将模型核心推理能力与原生视频工具相结合,能够从视频视觉帧、音频、转录文本当中动态检索、扫描、核验目标片段,显著降低视频分析的资源消耗与使用成本。
谷歌方面表示,以往模型处理视频多采用静态处理模式,按照固定帧率读取视频内容,默认帧率为1FPS。而全新的智能体视频理解功能,将模型核心推理能力与原生视频工具相结合,能够从视频视觉帧、音频、转录文本当中,动态检索、扫描、核验目标片段,实现从"被动读取"到"主动理解"的范式跃迁。
基准测试显示,搭载智能体视频理解能力的Gemini模型,最高可将视频分析成本降低66%,Token消耗量最高下降88%,分析准确率最高提升7%。
二、从静态帧到智能体的范式跃迁与传统静态处理模式形成鲜明对比的是,智能体视频理解赋予模型自主决策能力——它可以根据任务目标自主选择读取内容、播放速度,选取视频帧、音频、转录文本等信息模态,只提取任务所需片段与信号。以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具完成,有效缩减开发工作量。
该功能具备多项实用能力:支持亚秒级时刻检索,精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,助力高精度自动化视频编辑;可对时长数小时的长视频开展复杂内容检索,不用消耗海量Token资源;能够针对指定时间窗口调高采样帧率,完成快速运动画面、细微视觉异常的检测;还可以对时序下的重复动作、多类物体实现精准计数。
三、从开发者工具到消费者产品的全面渗透目前,这项功能已在Google AI Studio、Gemini企业智能体平台上线,支持本地视频上传与YouTube视频解析,开发者只需在接口配置中将处理模式设置为"agentic"即可开启。谷歌表示,Gemini 3.7 Flash搭配该新功能,综合表现最优,实现了分析质量与成本效率的良好平衡,处于视频理解任务准确率与成本的帕累托最优前沿。
按照谷歌规划,这项技术将逐步向消费级产品落地——后续将推送至Gemini应用全部Flash、Flash‑Lite模型用户;未来数月,智能体视频理解还将赋能YouTube视频页面的"Ask YouTube"功能,依托Gemini模型输出更贴合视频画面内容的问答结果。这项功能沿用Gemini API标准Token计费规则,不额外收取功能使用费,极大降低了开发者的使用门槛。
视频理解正在从"看画面"进化为"理解内容",AI的智能体化趋势愈发明显。
综合环球网、爱范儿、CSDN报道 | 2026年9月4日