🎯 科技 · AI大模型

🔥 谷歌六周内第三次发布Flash模型,Gemini 3.8定位从"小模型"转向AI智能体底层引擎

美东时间9月2日,谷歌DeepMind正式上线Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型。距离上一代Gemini 3.7 Flash发布仅过去三周,谷歌便再次更新Flash系列,其迭代速度之快在AI业界罕见。独立基准测试机构Artificial Analysis指出,3.8 Flash已是谷歌不到四个月内推出的第四款Flash模型,六周之内第三度亮相。

谷歌将Gemini 3.8定义为"迄今最强的推理和编程模型",两款新模型均通过长时间运行的智能体循环,不断评估和优化任务执行结果。这种"做得更多"的设计理念,意味着模型不再满足于单次代码生成,而是强调规划、执行、检查和修正的完整闭环。

Gemini 3.8 Flash的核心升级方向是长周期软件工程和自主智能体工作流。在DeepSWE v1.1长周期软件工程测试中,该模型能够自主解决复杂工程问题并完成端到端任务,表现超过多数规模更大的前沿模型。在金融、法律等专业领域的智能体测试中,新模型在HLE-Verified测试中得分达到54.9%。

在谷歌内部编程工具Jetski的对比测试中,部分工程师对Gemini 3.8 Flash的偏好甚至超过了Anthropic的Opus模型。这意味着谷歌正在持续缩小与Claude、OpenAI等模型在编程能力上的差距。谷歌还展示了更具说服力的案例:通过Antigravity仅凭一个提示生成可运行的3D游戏、生成可运行的DOS版Google Maps,以及在AI Studio中生成硬件拆解的交互式3D可视化工具。

在性能提升的同时,谷歌继续维持低价策略。Gemini 3.8 Flash的引导价格为每百万输入Token 0.75美元、每百万输出Token 3.75美元,优惠持续至今年年底,与3.7 Flash价格持平。Artificial Analysis评测显示,3.8 Flash高推理档在综合智能指数中获得59分,较3.7 Flash提升3分,以每项任务约0.58美元的成本进入"智能程度—任务成本"性价比前沿。

Flash系列的定位正在发生根本性变化:它不再只是一个追求速度和低成本的"小模型",而是逐渐成为谷歌推动AI智能体落地的重要底层引擎。随着模型执行更多推理步骤并反复调用工具,Token消耗也随之增加,但这正是从"聊天工具"向"工作伙伴"演进必须付出的代价。

综合华尔街见闻、界面新闻、人人都是产品经理报道 | 2026年9月3日