🎯 科技 · AI大模型
一、Flash系列再次加速迭代🔥 谷歌三周迭代Flash系列,Gemini 3.8主打编程Agent与网安自动修复
美东时间9月2日,谷歌宣布推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型,分别瞄准长周期编程智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌再次刷新Flash系列迭代速度。六周内第三次发布Flash模型,谷歌这波操作背后,是对AI Coding和Agent赛道的紧迫感。
独立AI基准测试机构Artificial Analysis数据显示,3.8 Flash高推理档综合智能指数获得59分,较3.7 Flash提升3分,以每项任务约0.58美元的成本进入"智能程度—任务成本"性价比前沿。价格策略延续:每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底。
二、编程能力逼近Claude OpusGemini 3.8 Flash的核心升级,是从单次代码生成转向长周期软件工程和自主智能体。在DeepSWE v1.1长周期软件工程测试中,模型能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。谷歌内部编程工具Jetski的对比测试中,部分工程师对Gemini 3.8 Flash的偏好甚至超过了Anthropic的Claude Opus模型。
AI正在从"回答问题"走向"动手执行任务",这是谷歌对Flash系列定位的重新定义。3.8 Flash在复杂任务上执行更多推理步骤,反复调用工具,通过长时间运行的智能体循环对自身结果进行评估和优化。谷歌展示的案例包括:仅凭一个提示生成可运行的3D游戏、生成可运行的DOS版Google Maps、在AI Studio中生成硬件拆解交互式3D可视化工具。
三、网安模型瞄准自动修复与此同时发布的Gemini 3.8 Flash Cyber,是谷歌面向网络安全领域的专用模型。它能发现此前未知的安全漏洞,并在无需人类指导的情况下加以利用和修复。这意味着AI正从"发现问题"走向"自动修复问题",网络安全防御范式面临重构。
在HLE-Verified测试中,3.8 Flash得分达到54.9%,在金融、法律等专业领域的智能体测试中也有所提升。#谷歌Gemini 3.8两款新模型发布#引发业界热议,标志着头部厂商的AI模型竞争已从基准测试分数比拼,转向实际工程落地和Agent自动化能力的贴身肉搏。
综合华尔街见闻、界面新闻、金融界报道 | 2026年9月3日