🎯 科技 · AI
🔥 GPT-6能力确实断层领先,但用户实际体验与官方宣传之间存在明显落差
9月4日,OpenAI正式发布新一代旗舰模型GPT-6 Astra,宣传片里它能自主建模火箭、操控3D打印机、通过48个网页验证码关卡,堪称"AI中的六边形战士"。然而,首批用户实测后却给出了一个矛盾的评价:很强,但被吹过头了。#GPT-6 被实测「很强但被吹过头了」,你如何评价这款模型?#
从硬指标看,GPT-6确实进步巨大。xbench最新月报显示,GPT-6 Astra在BabyVision多模态理解评测中拿下88.92分,距人类基线94.10仅差5.18分,领先第二名Gemini 3.8 Flash整整15.47分,创造了榜单有史以来最大的第一名领先幅度。在ScreenSpot-Pro无工具设置下,GPT-6得分92.7%,比上一代GPT-5.6 Sol的76.9%跃升了近16个百分点。
更让人瞠目的是,GPT-6在neal.fun的"我不是机器人"网页游戏中通关了全部48个关卡,包括涂鸦墙找威利、配音板玩"西蒙说"、画完美圆等人类都觉得刁钻的任务。要知道,2023年USENIX Security的研究显示,机器人验证码准确率85%-100%,而真人只有50%-85%——AI已经反超人类。
二、用户为何觉得"被吹过头"?
问题出在宣传与实际使用场景的落差。宣传片展示的是精心设计的demo场景:语音指令→自主建模→3D打印,一气呵成。但普通用户拿到手后发现,GPT-6在日常对话中的提升感知并不明显,尤其在中文语境下,幻觉问题依然存在,复杂推理偶尔"翻车"。正如一位网友所说:"宣传视频像科幻片,实际用起来还是得自己兜底。"
OpenAI产品负责人Tibo自己也承认:"客户对GPT-6 Astra的需求真的是史无前例的,我们正在动用一切可能的杠杆来维持。"但需求暴涨的背后,是Pro订阅可能暂停的现实——算力瓶颈让最强模型无法人人用上,这本身就加剧了"吹过头"的观感。
三、行业格局正在重塑
值得注意的是,GPT-6的发布节奏正在倒逼整个行业加速。截至9月8日,已有7家公司密集发布新模型:Claude Fable 5.1、Gemini 3.8 Flash、Qwen3.8-Max、DeepSeek V4等。ScienceQA榜单头部密度持续上升,各家模型分数挤在69-85分区间,竞争从"谁更强"转向"谁更划算"。
OpenAI还在深化与三星的合作,推进自研AI芯片Jalapeno量产。韩国ChatGPT企业版用户数一年暴增28倍,三星成为全球最大企业部署客户。GPT-6的能力毋庸置疑,但"被吹过头"的争议提醒我们:技术突破是一回事,用户体验是另一回事。模型再强,落地才是王道。
综合爱范儿、华尔街见闻、xbench报道 | 2026-09-10
收起 ▲