谷歌DeepMind于9月1日宣布为Gemini系列模型上线agentic视频理解功能。该功能使AI能够深入分析视频内容,识别其中的人物、动作、物体和场景变化,并生成详细的结构化描述。这是继文本、图像理解之后,谷歌在AI多模态能力上的又一重要突破。同时,谷歌Workspace新增了基于Nano Banana模型的图像生成与编辑工具Google Pics,进一步丰富了AI办公产品线。分析指出,谷歌正通过多模态能力构建与OpenAI、Anthropic的差异化竞争壁垒。
谷歌DeepMind于9月1日宣布为Gemini系列模型上线agentic视频理解功能。该功能使AI能够深入分析视频内容,识别其中的人物、动作、物体和场景变化,并生成详细的结构化描述。这是继文本、图像理解之后,谷歌在AI多模态能力上的又一重要突破。同时,谷歌Workspace新增了基于Nano Banana模型的图像生成与编辑工具Google Pics,进一步丰富了AI办公产品线。分析指出,谷歌正通过多模态能力构建与OpenAI、Anthropic的差异化竞争壁垒。