🤖 AI大模型 · 科技评测
一、升级了个寂寞——评测数据原地踏步🔥 Gemini 3.6 Flash顶着更高版本号原地踏步,谷歌AI旗舰难产、替补拉胯的困局仍在延续。
7月21日,谷歌发布Gemini 3.6 Flash,但很快被开发者贴上"史上最差迭代"的标签。第三方测评机构Artificial Analysis给出的综合评分与上一代Gemini 3.5 Flash完全持平,都是50分,在187个模型排行榜中仅列第11位。排在它前面的,是Claude Fable 5的60分、GPT-5.6 Sol的59分、Kimi K3的57分——全是竞品的旗舰或次旗舰。有开发者尖锐吐槽:"快速生成错误答案等于用更高效率浪费用户时间。"这个话题 #如何评价Gemini3.6Flash# 在技术社区持续发酵,开发者普遍认为这次更新诚意不足。
实际上,3.6 Flash并非毫无进步。DeepSWE编程基准从37%提升到49%,MLE-Bench机器学习研究从49.7%涨到63.9%,OSWorld电脑操控从78.4%提升至83%。但问题在于,这些小修小补在对手动辄几十个点的代际飞跃面前,显得像在挤牙膏。Arena.ai前端代码竞技场中,3.6 Flash以1537分排第12,甚至不如Meta的Muse Spark 1.1。
二、唯一的亮点:让AI更"省"了如果非要说3.6 Flash做对了什么,那就是Token效率。官方数据显示,输出Token消耗比3.5 Flash平均减少17%,输出价格从每百万9美元降至7.5美元,降幅16.7%。输入价格保持1.5美元不变。在当前AI应用大规模部署的背景下,省Token就是省钱——尤其对高频调用场景来说,一年下来成本差异可观。正因如此,上周OpenRouter数据显示3.6 Flash周调用量达2.33万亿Token,环比暴涨446%,首次进入全球前十。
另外,3.6 Flash在知识工作方面也有进步:GDPval-AA v2基准1421分(3.5 Flash为1349分),客户反馈在文档解析、图表分析、报告起草等多模态任务上表现出色。但问题在于,省钱和省Token不是用户选择AI的核心理由——性能才是。当竞品在推理能力和代码水平上不断突破时,单纯降成本很难建立技术壁垒。
三、谷歌AI的深层危机:旗舰难产,靠Flash续命3.6 Flash的尴尬,本质折射谷歌AI的战略困局。原定接棒的Gemini 3.5 Pro因内部测试编程能力不达标一再跳票——从6月底推到7月中,至今杳无音信。与此同时,OpenAI连发GPT-5.6 Sol/Luna/Terra,Anthropic推出Opus 5,月之暗面发布Kimi K3,谷歌成了近5个月里唯一没有旗舰模型产出的主要AI实验室。更讽刺的是,Transformer架构本就是谷歌团队2017年提出的,如今却眼睁睁看着别人用自家地基盖起了摩天大楼。
8月5日的谷歌AI人事地震——杰夫·迪恩等四人出走创立Discovery Loop——更将组织困境暴露无遗。多家产品线各自为政、审批流程冗长、对搜索广告业务的自缚手脚,都让这家曾定义AI方向的公司难以适应快节奏竞争。9.5亿月活用户也掩盖不了一个尴尬事实:绝大多数人只是被动"路过"Gemini,而非主动选择它。
综合钛媒体、新浪财经、Artificial Analysis、每日经济新闻报道 | 2026年8月11日