🎯 AI · 技术前沿

AI Agent长程任务能力的关键不在模型本身,而在记忆架构与反馈机制的设计

2026年的AI Agent研究正在跨越一道分水岭:从"单次对话能做什么"转向"连续运行8小时、甚至一周能做什么"。微软研究院2026年2月发布的CORPGEN框架给出了一个令人瞩目的数字——在100%负载下,任务完成率从4.3%跃升至15.2%,提升了3.5倍。这个成绩背后不是更大的模型,而是一个清晰的分层规划架构:战略层(月度目标)→战术层(每日计划)→操作层(单次工具调用)。每一层只在自身抽象级别上做决策,避免了一个模型试图同时处理规划与执行的混乱。

更有趣的是,BAAI智源社区2026年8月发布的Recuris架构进一步提出了"经验—工作记忆"递归演化机制。它的核心洞察是:长程任务的失败往往不是因为没有记忆,而是因为记忆的结构无法支持当前决策。Recuris将"工作记忆"用于实时追踪任务进展,引导从"经验记忆"中检索最适配的技能,而不是简单地回退到完整历史。

在Tau-Bench基准测试中,Recuris将Claude Opus 5的任务成功率推至87.9%,提升了15.6分;在SkillFlow上,Qwen3.6-35B的表现提升了13.5分。更重要的是,随着交互周期延长,Recuris的优势持续扩大——在最长周期任务上性能提升高达32.2分,常见长周期失败类型最多减少达80%。

一、记忆架构的三层革命

2026年长程Agent记忆研究呈现出三种不同范式。第一种是MemPrism(arxiv 2608.06745),它提出"任务条件化关系记忆"概念,将持久化体验存储与决策时的工作记忆分离。MemPrism用一个轻量级视图策略根据当前任务上下文动态构建关系视图,在长轨迹下,其成功率在50步时达到40.7%,而Full History基线仅为31.4%。

第二种范式是Memex(arxiv 2603.04257),它用"索引化经验记忆"解决上下文窗口瓶颈。Memex将完整交互归档到外部KV存储,同时在工作上下文中保留紧凑的索引摘要。当后续决策需要具体证据时,通过明确反引用索引恢复原始内容——这个过程不是语义匹配,而是确定性查找。MemexRL通过强化学习优化写政策和读政策,在紧凑的上下文预算内实现了显著的任务成功率提升。

第三种是微软CORPGEN的生产级方案,它提出的"渐进式记忆压缩"原则被广泛验证:关键内容(工具调用、状态变更)无损保留,常规内容(中间推理)压缩为结构化摘要。当上下文超过4000 token时,CORPGEN会触发智能的上下文分离——子代理负责网页研究等复杂操作,避免跨任务上下文污染。

二、反馈机制:从被动执行到主动纠错

长程Agent的第三个关键能力是反馈与纠错机制。耶鲁大学2026年4月发布的Goal2Skill框架采用了双系统架构:高层VLM规划器维护结构化任务记忆,在执行每个步骤后进行后置条件验证,未达标时触发错误驱动修正。

这个设计的核心是将验证循环变为第一类操作——规划器显式评估每个执行步骤是否达成了预期后置条件,而不是将验证当作事后补充。在RMBench基准上,Goal2Skill达到32.4%的成功率,而最佳基线仅为9.8%。消融实验表明:结构化记忆对记忆敏感型任务贡献最大(38.7% vs 9.0%),而显式验证与反思驱动了容错性提升

另一个重要进展是MiRA(2026年3月),它用密集里程碑奖励信号解决长程任务的稀疏奖励问题。传统RL微调只在任务完成时给奖励,导致模型难以学习哪些中间动作导致了成功。MiRA从教师模型生成子目标,在每个子目标完成时分配奖励,大幅增加了梯度信号的密度。更重要的是,它采用任务解耦规划——将任务分解为子目标的有向无环图(DAG),局部失败不会触发全局重新规划,只有受影响的DAG节点被重新评估。

三、模型能力 vs 架构设计:谁是瓶颈?

METR自2019年以来持续追踪任务完成时间 horizon。截至2026年5月,Claude Mythos在50%可靠性下的时间 horizon 至少达到16小时,80%可靠性下约3小时。更值得注意的是,能力翻倍的周期从2019-2025年的7个月压缩到了4.3个月——快了20%。

但这个加速度背后藏着一个被低估的瓶颈:上下文窗口退化。超过25-30次工具调用后,即使200K token的上下文窗口也会出现连贯性问题——模型开始遗忘早期结果、重复执行已完成步骤,或对已完成事项产生不一致认知。这就是METR所说的"上下文积累推理残骸"现象。

更隐蔽的问题是目标漂移。即使模型没有忘记任何信息,长程任务中目标语义可能随时间逐渐偏移,导致最后执行的操作与最初目标不再匹配。Sequoia Capital 2026年分析指出:2026年底能可靠完成8小时全工作日的Agent,以及2028年能完成40小时全工作周的Agent,将是知识工作AGI的功能阈值

综合来看,长程Agent能力的突破更多来自架构创新而非模型规模——分层规划、记忆分离、验证闭环和里程碑奖励机制的组合,让当前模型在长程任务中的表现比纯依赖模型规模提升了数倍。

综合LangChain博客、arxiv论文、BAAI智源社区、Sequoia Capital报道 | 2026年9月7日