🎯 科技 · AI大模型

🔥 谷歌Gemini 3.8 Flash周三发布,编程能力全面跃升,意图缩小与OpenAI、Anthropic的差距

一、编程基准成绩大幅提升

谷歌最快本周三发布Gemini 3.8 Flash AI模型,这是谷歌Gemini系列中针对编程场景深度优化的最新版本。据第三方评测数据,新版模型在FrontierCode 1.1 Main测试中得分43.6%,较3.6 Flash的34.4%提升了9.2个百分点;在DeepSWE v1.1测试中从49.0%跃升至65.3%,增幅超过16个百分点。在WebDev Arena编程能力排行榜中,Elo评分从1538分提升至1588分。这些数据表明,谷歌正在通过高频迭代快速补齐编程短板。谷歌内部员工在编程工具测试中,更倾向于使用Gemini 3.8 Flash而非Claude Opus,这一细节虽不能等同于市场竞争力,但足以说明谷歌对自身模型的信心。

在AI编程场景下,开发者最需要的是模型能理解现有代码、定位Bug、调用工具并交付可用应用。谷歌表示,3.8 Flash在 multi-step planning和 tool call过程中能够进行更深入"思考",遇到障碍时可自主调整策略,减少人工干预。

二、价格策略抢占开发者市场

谷歌此次发布同样注重性价比。3.8 Flash的入门级定价将持续至2026年底,之后将恢复至每百万输入token 1.5美元、输出token 7.5美元的标准价格。这个定价策略在OpenAI和Anthropic接连涨价的背景下显得尤为激进。 Anthropic最新发布的Claude Fable 5.1虽然缓存读取价格下降了75%,但实际单次任务成本反而比上代高出20%——主因是模型推理深度增强,输出token量达到后者的1.7倍。谷歌选择在此时推出高性价比编程模型,无疑是在争夺企业开发者的注意力。

中金公司研报指出,开源模型正以高性价比+高智能水平赢得海内外用户广泛认可,2027年全球开源模型调用量预计占总Token量的50%—70%。谷歌此次通过Flash系列高频更新,正是在这一趋势下巩固自身地位的关键落子。模型行业的竞争已从单纯比拼基准测试分数,转向性价比与生态粘性的综合较量。

三、巨头混战背后的深层逻辑

谷歌Gemini 3.8 Flash的发布,正值AI大模型竞争最白热化的阶段。OpenAI即将推出突破网络安全能力阈值的Astra模型,Anthropic同步发布Fable 5.1和Mythos 5.1双版本,阿里则更新Qwen3.8-Max并登顶CodeArena编程榜。四家头部厂商在同一时间窗口密集释放新模型信号,标志着短暂"熄火"后的前沿模型更迭竞争再次提速。

值得关注的是,本轮竞赛的另一条主线逐渐清晰:随着模型能力逼近网络安全关键门槛,厂商正集体将安全部署从后台议题推向前台。OpenAI在8月联合Anthropic、亚马逊、谷歌、微软等百余家机构发出公开信,警告AI发起的网络攻击将愈发广泛复杂。而谷歌在Flash系列中强化编程能力的同时,也暗示了对模型安全边界的把控。当AI编程能力日益接近甚至超越人类开发者,如何确保这些代码不被滥用,将成为行业共同的"必答题"

综合界面新闻、财联社、观察者网报道 | 2026年9月2日