🎯 科技 · AI

🔥 四天内连发两款Flash模型,谷歌迭代速度刷新纪录,内部测试偏好率反超Claude Opus

一、Flash系列六周连发三次

美东时间9月2日,谷歌DeepMind正式推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型,分别瞄准长周期编程、智能体工作流与复杂推理,以及网络安全漏洞发现和自动修复。谷歌称,3.8 Flash是其迄今"最强的推理和编程模型"

令人惊讶的是迭代速度:距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌就再次推出新版本。这已是谷歌六周内第三次发布Flash模型,独立AI基准测试机构Artificial Analysis指出,3.8 Flash已是谷歌不到四个月内推出的第四款Flash模型。相比之下,竞争对手的模型迭代周期普遍在2-3个月。

二、编程测试偏好率超Claude Opus

在性能方面,Artificial Analysis评测显示,Gemini 3.8 Flash高推理档在综合智能指数中获得59分,较3.7 Flash提升3分,以每项任务约0.58美元的成本进入"智能程度—任务成本"性价比前沿。更引人注目的是内部测试结果:谷歌工程师在编程工具Jetski的对比测试中,对3.8 Flash的偏好甚至超过了Claude Opus

谷歌展示的案例也更加贴近实际生产环境:通过Antigravity仅凭一个提示生成可运行的3D游戏、生成能够运行的DOS版Google Maps,以及在AI Studio中生成硬件拆解的交互式3D可视化工具。在DeepSWE v1.1长周期软件工程测试中,3.8 Flash能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。

三、价格策略持续凶猛

在性能大幅提升的同时,谷歌继续维持低价策略:Gemini 3.8 Flash的引导价格与3.7 Flash相同,为每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底。这意味着用户可以用几乎不变的成本,获得显著更强的编程和推理能力。

Flash系列的定位正在发生根本性转变:它不再只是一个追求速度和低成本的"小模型",而是逐渐成为谷歌推动AI智能体落地的重要底层模型。在长周期编程和自主智能体领域,谷歌正加速缩小与OpenAI和Anthropic的技术差距。

综合华尔街见闻、界面新闻、人人都是产品经理报道 | 2026年9月3日