当全球AI巨头还在卷大模型参数规模时,英伟达用一款编码智能体AVO直接交出了满分答卷。在专为测试“类人抽象推理”设计的ARC-AGI-3基准上,AVO以100%的通过率横扫全部25个公开游戏、183个关卡——这不是传统意义上的刷分,而是对“智能体工程”这一全新赛道的统治级宣告。
最让人意外的是,AVO的杀手锏并非更大规模的模型,而是一套被称为“缰绳层”(harness/scaffolding)的外部控制框架。它不接收任何规则或目标说明,纯粹依靠外部提示工程与自纠错循环,将通用模型“驯化”成能从头解决未见难题的智能体。换句话说,同样的基座模型,配上更聪明的缰绳层,就能在ARC-AGI-3上实现碾压——这彻底改写了“性能=参数”的旧等式。
深挖这背后的逻辑,你会发现英伟达真正要抢的不是一张榜单,而是大模型竞赛下半场的“系统级工程”话语权。当所有人还在比谁的GPU集群更大、谁的预训练数据更多时,AVO用满分证明:智能体脚手架、上下文管理、工具调用、自纠错循环这一整套agent工程,才是决定模型上限的胜负手。堆参数的上半场已经结束,下半场拼的是谁能让模型“会干活”。
更进一步看,英伟达这步棋是在为自家GPU与CUDA生态铺设“人工智能体操作系统”的野心。未来谁掌握智能体工程,谁就掌握算力落地的话语权——AVO的满分,既是科研实力的展示,更是对AI基础设施霸权的一次精准卡位。
当大模型竞赛从“堆参数”转向“拼工程”,英伟达用一块满分招牌,重新定义了AI竞争的起跑线。
AI 生成 . DeepSeek | 搜索综合