🎯 科技 · AI大模型
🔥 谷歌六周内第三次更新Flash系列,Gemini 3.8 Flash瞄准编程与智能体,内部测试偏好超越Claude Opus
美东时间9月2日,Google DeepMind正式发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型。距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌再次加速迭代——这是六周内第三次推出Flash系列,也是不到四个月内第四款Flash模型。谷歌宣称,Gemini 3.8是其迄今"最强的推理和编程模型"。
此次升级的核心方向非常明确:长周期编程、自主智能体工作流和复杂推理。在谷歌内部编程工具Jetski的对比测试中,部分工程师对Gemini 3.8 Flash的偏好甚至超过了Anthropic的Claude Opus模型。在DeepSWE v1.1长周期软件工程测试中,3.8 Flash能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。在HLE-Verified测试中得分达到54.9%,显示出在金融、法律等专业领域智能体能力的显著提升。
更具象的体验升级来自谷歌展示的实际案例:通过Antigravity仅凭一个提示就能生成可运行的3D游戏、生成能够运行的DOS版Google Maps,以及在AI Studio中生成硬件拆解的交互式3D可视化工具。这些场景不再是简单的代码补全,而是"规划—执行—检查—修正"的完整闭环,模型被赋予了"把事情做完"的能力。
价格方面,谷歌继续维持低价策略。Gemini 3.8 Flash的引导价格为每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底。独立评测机构Artificial Analysis显示,3.8 Flash高推理档综合智能指数获得59分,较3.7 Flash提升3分,以每项任务约0.58美元的成本进入"智能程度—任务成本"性价比前沿。
值得关注的是,Flash系列正在从"追求速度和低成本的小模型"逐渐转变为谷歌推动AI智能体落地的重要底层模型。与此同时,旗舰版Gemini 3.5 Pro仍无明确发布日期,Flash系列高频更新与Pro系列迟迟不来的反差,也成为外界观察谷歌AI产品策略的一个独特窗口。
综合华尔街见闻、界面新闻、人人都是产品经理报道 | 2026年9月3日