当硅谷的VC还在为AI取代程序员争论不休时,一场更隐秘的降维打击已经发生。a16z最新研究显示,顶级AI Agent在OSWorld基准测试中任务完成率已达85%,而人类平均水平仅为72%。更震撼的是成本:AI Agent每小时运行成本仅6-8美元,比印度离岸BPO的10美元低20%-40%,比美国本土30-45美元的人力成本低了整整70%以上。这意味着,在电脑操作这件事上,AI已经同时打赢了价格战和性能战。

回看一年前的数据,最强大模型在OSWorld上的完成率仅为42%,距离可用相去甚远。但2026年2月发布的Claude Opus 4.6成为分水岭——它首次将Agent能力推过85%的可用性门槛。这个数字背后是质变:当AI能自主完成绝大多数桌面端、网页端操作任务时,企业级外包的逻辑被彻底改写。你不再需要为人的时区、情绪、离职率买单,只需为算力支付一个近乎荒谬的折扣价。

然而,85%的完成率意味着每100个任务仍有15个会失败——这恰恰是行业真正的分水岭。那些吹嘘全自动化的厂商忽略了一个事实:AI Agent的护城河从来不在模型参数,而在于工程化的容错体系。验证机制(如何确认任务真正完成)、异常上报(如何优雅地承认我卡住了)、错误处理(如何从失败中自愈并重试),这三者才是决定企业敢不敢把核心流程交给Agent的关键。一个能清晰说我不确定并请求人工介入的Agent,远比一个假装全能的Agent更有商业价值。

这带来一个残酷的行业位移:价值洼地正从模型层向应用与上下文层快速转移。底层大模型越来越像水电煤,而真正能赚取超额利润的,是那些掌握了特定行业操作流程、界面交互细节、异常处理知识库的中间层玩家。它们不生产模型,但比任何人都更懂如何让模型在真实业务里不出错。对于创业者而言,现在再投模型训练等于跳入红海,而深耕某个垂直领域的Agent工作流,用上下文工程把完成率从85%推向95%,才是真正的蓝海。

这场变革对全球劳动力市场的冲击是结构性的。印度班加罗尔的BPO写字楼里,数十万做着数据录入、报表处理、邮件回复的年轻人,或许将在三年内面临第一波失业潮。但历史的经验告诉我们,每次技术替代都会催生新岗位——只是这次的新岗位不再要求会操作电脑,而是要求会设计电脑的操作逻辑。当Agent的时薪低于一顿午餐时,人类唯一不可替代的,只剩下定义问题、设定边界、以及为那15%的失败兜底的能力。