🎯 科技 · AI产品

🔥 谷歌Gemini新增智能体视频理解功能,分析成本直降66%

一、从"固定帧率"到"自主决策"的跨越

#谷歌Gemini视频理解成本降66%#9月3日,谷歌宣布为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash-Lite模型新增智能体视频理解功能。这一更新标志着视频分析从传统的"固定帧率读取"模式迈入"智能体自主决策"新阶段。以往模型处理视频多采用静态模式,按固定帧率(默认1FPS)读取内容,开发者需手动调整参数权衡Token开销与细节丢失。

全新功能将模型核心推理能力与原生视频工具深度结合,能够根据任务目标自主选择读取内容、播放速度,从视频视觉帧、音频、转录文本中动态检索、扫描、核验目标片段。这意味着模型不再"逐帧盲扫",而是像人类一样有选择性地聚焦关键画面,大幅降低无效计算。

二、成本降66%、Token消耗降88%,准确率反升7%

谷歌公布的基准测试数据相当亮眼:搭载智能体视频理解能力的Gemini模型,最高可将视频分析成本降低66%,Token消耗量最高下降88%,分析准确率最高提升7%。在长视频处理场景中,这一优势尤为突出——传统模式下开发者往往在高额Token开销与遗失关键细节之间做取舍,新技术则有效摆脱了这一困境。

谷歌指出,Gemini 3.7 Flash搭配该新功能综合表现最优,实现了分析质量与成本效率的良好平衡。该功能支持亚秒级时刻检索、数小时长视频复杂内容检索、快速运动画面检测以及时序重复动作精准计数等实用能力,开发者只需在接口配置中将处理模式设置为"agentic"即可开启。

三、从开发者工具到YouTube"Ask YouTube"

目前,智能体视频理解功能已在Google AI Studio和Gemini企业智能体平台的API上线,支持本地视频上传与YouTube视频解析。谷歌方面透露,该功能将逐步向面向普通用户的产品落地,后续推送至Gemini应用全部Flash、Flash-Lite模型用户。

更有看点的是,未来数月该功能还将赋能YouTube视频页面的"Ask YouTube"功能,依托Gemini模型输出更贴合视频画面内容的问答结果。当用户再问"视频里那个产品是什么牌子"时,AI不再需要你手动翻进度条。谷歌再次将AI能力嵌入全球最大视频平台,巩固其在多模态领域的竞争壁垒。

综合环球网、第一财经、科创板日报报道 | 2026年9月4日