9月7日,Sierra与普林斯顿大学联合发布新基准τ^τ-Bench,把构建智能体本身设为考题:开发者智能体要面对真实业务记录、带真实诉求的客户、生产级API和遗留代码库,交付一个可用的客服智能体。结果显示:Claude Opus 5在Claude Code辅助下仅通过23.9%,而人类专家参考成绩高达82.2%。当全行业都在讲agent写agent、模型造模型时,这个基准像一盆冷水——即便是当下最强AI模型,在真实业务约束下搭建智能体成功率也不到人类专家的三分之一。