🎯 科技 · AI大模型

🔥 9月仅4天,6大厂商轮番上阵,大模型进入"周抛时代"

9月刚刚过去四天,全球AI大模型赛道已经上演了一出"神仙打架"。OpenAI发布GPT-6 Astra,Anthropic推出Claude Fable 5.1,谷歌甩出Gemini 3.8 Flash,Meta祭出Muse Spark 1.3,国内阿里、智谱、腾讯也紧随其后。Benchmark排行榜上,最强模型的保质期从几个月缩短到不到一周,"周抛"正在成为大模型行业的新常态。

OpenAI的GPT-6 Astra号称"史上最智能模型",在电脑操作测试中得分72.6%,比上一代GPT-5.6 Sol的65.7%显著提升,完成任务平均用时从75分钟缩短至40分钟。总裁Greg Brockman更是放话"欢迎来到AGI时代"。但有意思的是,同一模型在统一测试环境下得分从99.9%骤降至62.7%,AGI的成色还需时间检验。

Anthropic的Claude Fable 5.1主打高性价比,官方称典型工作负载成本降低约25%,复杂编程任务节省可达45%。谷歌的Gemini 3.8 Flash则在RSI(递归式自我改进)机制上实现突破。Meta的Muse Spark 1.3在编程和长上下文测试中全面领先。国内方面,阿里千问Qwen3.8-Flash、智谱GLM-5.3-Flash、腾讯混元Hy4 preview相继上线,开源模型下载量首次超越美国。

为什么模型发布节奏突然加快?核心驱动力来自两方面:一是RSI机制让AI参与自身研发流程,迭代周期大幅缩短;二是大模型训练从"造神工程"变成"流水线生产",后训练、强化学习、推理优化等环节日益工程化。专家预测,RSI即将开启模型发布的新周期,"周抛"马上要成为过去式。

综合界面新闻、新华社、21世纪经济报道报道 | 2026年9月5日