🤖 AI · 大模型趣谈

🔥 用"鲁迅全集"当计量单位来衡量大模型数据量,看似段子实则精准——Claude的训练语料足够吃下至少三千个鲁迅一生的创作。

一、一个AI圈经典段子的诞生

如果你混迹AI技术社区,一定见过这个灵魂拷问:"Claude究竟吃了多少个鲁迅"。这个梗的起点其实来自知乎和即刻网友,当时有人把GPT-3的3000亿token训练数据换算成中文语境——鲁迅一生大约写了700万字,折合约1000万token。一除之下,GPT-3一个模型"啃"下去的文本量,够鲁迅大爷轮回转世写30万辈子。于是"吃鲁迅"就成了AI圈丈量训练数据量的野生单位,就像物理学家用"大象"量质量、程序员用"核桃"量脑容量一样荒诞又精准。

到了2026年,"#Claude究竟吃了多少个鲁迅#"这个问题已经从段子升级为半严肃的技术讨论。Anthropic从未公布Claude完整训练数据规模,但行业估算其旗舰模型训练数据量在15万亿至30万亿token之间。按中文折算,大约相当于三千到六千个"鲁迅全集"级别。换句话说,Claude这辈子读过的中文,可能比在座所有中国人加起来读过的鲁迅还多——只不过它读完不会背"横眉冷对千夫指",而是直接给你写周报。

二、"吃鲁迅"背后的数据军备竞赛

别光顾着乐,这梗其实触及了大模型行业最核心的焦虑:数据。2026年全球主流大模型的训练数据规模已经膨胀到令人窒息的程度——GPT-5据估训练数据超过100万亿token,Google Gemini Ultra也在同一量级。翻译成"鲁迅单位",那就是两万个鲁迅起步。而讽刺的是,高品质的人类原创文本正在被"吃干抹净"——据Epoch AI研究机构统计,网上公开可爬取的高质量文本数据大约在2028年前后就将被彻底耗尽

更扎心的是成本。量子位近期报道了一个震撼案例:亚马逊用Claude Sonnet自动填充网站作者信息,一个看起来简单到发指的任务,结果Agent日夜不休地重试——最终烧了180万美元,超过预算860%,拖了5个月才被发现,还没部署成功。按Claude每百万输出token 15美元的公开价折算,这点小任务消耗的token量已经相当于把鲁迅全集来回吃了好几遍。AI不理解情怀,硅谷不相信眼泪——但账单会说话。

三、"吃多少鲁迅"不重要,重要的是消化了多少

说到底,"吃鲁迅"只是圈内人的黑色幽默,真正值得关注的是:大模型吃了这么多数据,到底有没有变成更好的模型?目前行业正从"比谁吃得多"转向"比谁消化好"。数据质量远比数据量重要——中国开源模型的崛起就是明证。斯坦福2026年AI指数报告显示,中美顶尖模型性能差距仅剩2.7%,而中国厂商在训练数据规模可能更小的情况下,通过精筛数据和工程优化实现了接近的智能水平。

所以说,"Claude究竟吃了多少个鲁迅"这个问题的最佳答案或许不是一串数字,而是一个提醒:大模型的核心竞争力正在从粗暴的数据堆量,转向数据筛选、合成数据生成和高效训练策略的三位一体。鲁迅大爷如果有灵,看到自己的全集被AI当压缩饼干啃,大概会点上一支烟说:"从来如此,便对么?"——但账单确实不骗人。

综合量子位、斯坦福AI指数报告、Epoch AI及AI社区网友讨论 | 2026年8月10日