🎯 科技 · AI前沿
🔥 谷歌六周内第三代Flash模型,编程能力逼近Claude旗舰,Cyber版专职挖漏洞
一、
#谷歌发布Gemini 3.8 Flash# 编程能力全面跃升
谷歌DeepMind于9月6日正式发布Gemini 3.8 Flash,这是六周内谷歌推出的第三代Flash系列模型(7月21日3.6、8月13日3.7、9月6日3.8)。新版本在推理能力、编程实力和智能体工作流表现上实现全面升级,整体性能大幅逼近高阶旗舰模型。
在权威基准测试DeepSWE v1.1上,3.8 Flash达到73.7%的通过率,与Claude Opus 5的74.0%几乎持平,超越GPT-5.6 Sol的72.7%。第三方Datacurve编程榜上,3.8 Flash与Opus 5并列第一,但单题成本仅2.36美元,而Opus 5需要11.84美元——性价比差距五倍,堪称AI编程界的"平替之王"。
二、Cyber专属版:AI专职找漏洞,成本碾压同行
同日发布的Gemini 3.8 Flash Cyber是谷歌首款面向网络安全场景的专属模型,通过Fairwind受控计划定向开放。该版本专为漏洞检测、代码防护、安全修复深度优化,在CyberGym基准的C/C++漏洞发现任务上Pass@1达86.2%,较上代3.5 Flash Cyber提升近9个百分点。
在覆盖20种编程语言的综合测试中,漏洞识别成功率突破70%。谷歌云漏洞研究团队实测,Cyber版在两个小时内发现了一个关键漏洞——这类漏洞以往人类专家通常需要数月才能定位。Chrome安全团队评估其生成的正确修复补丁数量是此前最佳商业模型的2.6倍,CWE-Bench补丁修复通过率47.2%,与GPT-5.6的47.8%几乎持平,但成本优势绝对领先。
三、定价与展望:2026年底前的"抄底窗口"
3.8 Flash延续3.7 Flash的优惠定价:输入每百万token 0.75美元、输出3.75美元,该价格执行至2026年12月31日。2027年1月起将恢复标准定价,输入涨至1.50美元、输出7.50美元。这意味着当前是部署低成本AI编程和智能体应用的最佳窗口期。
从"写代码"到"找代码毛病",谷歌用3.8 Flash双线出击,既守住性价比优势,又切入高价值的网络安全赛道。随着Flash系列迭代节奏缩短至两周一次,大模型的性能进化曲线正在加速,对开发者的成本红利也持续释放。
综合36氪、CSDN、谷歌DeepMind官方博客报道 | 2026年9月7日
收起 ▲