ACE 论文汇报 · 目录
Paper Deep DiveICLR 2026 · arXiv:2510.04618v3

ACE:把上下文变成会持续进化的 Playbook

从 brevity bias 与 context collapse 出发,理解结构化增量上下文为何能够支持 LLM 在不更新权重的情况下持续学习。

论文标题
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
主要作者
Qizheng Zhang、Changran Hu 等
研究机构
Stanford University、SambaNova Systems、UC Berkeley
评测范围
AppWorld、FiNER、Formula,并扩展至 DDXPlus、BIRD-SQL 与多种 LLM
核心判断:ACE 的关键不是“增加三个 Agent”,而是把完整上下文变成持久状态,让 LLM 只提交局部 delta,再用确定性逻辑合并,从机制上避免一次生成覆盖全部历史。
01 · Background

为什么“上下文”值得成为学习接口

现代 LLM 系统的真实能力不只来自权重。系统提示词规定行为,memory 保存经验,检索证据补足事实;这些输入共同决定模型在当前环境里能做什么。

论文把 context adaptation 定义为:不改变模型参数,而是在训练结束后,通过修改指令、推理策略、示例、memory 或证据来改善行为。它与微调的区别不只是成本更低,还在于 context 可以被人阅读与审计、可以在运行时迅速加入新知识,也可以跨模型和 compound AI system 的不同模块共享。

长上下文模型和 KV cache 复用使这种路径越来越可部署。于是问题发生了变化:既然 context 要承担持续学习,它就不能只是一段静态 prompt,而必须能吸收新经验、保留旧经验,并允许系统知道哪条经验曾经有用或有害。

可解释知识以自然语言和结构化条目存在,可被开发者检查。
运行时更新新规则和新事实不必等待下一轮模型训练。
跨模块共享同一份 context 可服务多个模型或 Agent 组件。
可治理错误知识原则上可定位、删除、回滚,而非藏在权重中。

但“可以改 context”不等于“会正确地改 context”。ACE 的方法选择来自两个具体而非抽象的失败。

02 · Motivation

现有方法的两个失败模式

Brevity bias

prompt 优化倾向于生成短、通用、容易在验证集上复用的说明,却删掉领域规则、工具细节、边界情况和失败模式。

根因:把抽象和简短默认当作高质量 context 的目标。

Context collapse

每轮让 LLM 重写完整 memory 时,一次过度压缩就可能覆盖之前所有积累,长期状态没有保护。

根因:用不可控的全文生成承担数据库式状态更新。

Brevity bias 的论据不是“短 prompt 一定不好”

作者引用 prompt optimization 在 test generation 上反复收敛到近乎相同泛化指令的现象,例如“创建单元测试以确保方法按预期运行”。这句话没有错误,但它没有保存某个库、API 或故障类型的可执行知识。对多步 Agent、程序生成和专业推理而言,成功往往依赖大量难以压成一句原则的局部细节。

论文主张在知识密集和环境密集任务中,context 应是详细、包容、结构化的 playbook。LLM 可以在推理时选择相关细节,因此作者偏向“先保留、后选择”,而不是“先压缩、再执行”。

Context collapse 的直接案例

AppWorld 上上下文从 18282 tokens 突然坍缩为 122 tokens 的曲线
Figure 2 · Context Collapse(论文第 3 页)。第 60 步上下文为 18,282 tokens、准确率 66.7;下一步缩为 122 tokens、准确率降至 57.1,低于无适应基线 63.7。图中直接支持的是“全量重写可能造成状态断崖式丢失”,并不等价于所有长 context 都更好。

直接证据token 数量与准确率同步断崖式下降,说明更新操作本身可能破坏长期知识。旧信息是否存在,不能只依赖下一次 LLM 是否愿意复述。

03 · Research Question

研究问题如何从失败模式推导出来

ACE 不是泛泛地寻找“更好的 prompt”,而是在回答:context 能否成为一个持续生长、局部修订、质量可追踪、同时可控制冗余的长期知识结构?

现实趋势模型部署后的行为越来越由 prompt、memory 和证据决定。
内容问题brevity bias 会删除真正决定任务成败的领域细节。
更新问题monolithic rewrite 允许一次生成覆盖全部历史状态。
设计结论context 应条目化,更新应局部化,合并应确定化。

作者据此提出三项对应设计:专门的 Reflector 把执行与经验提炼分开;incremental delta update 取代完整重写;grow-and-refine 在持续积累和冗余控制之间平衡。这里的创新逻辑是职责分离加受约束的状态变更,而不是简单增加调用次数。

04 · Representation

Playbook:把一段 prompt 改造成可维护条目

ACE 的 context 由结构化 bullet 组成。每条 bullet 有唯一 ID、helpful/harmful 计数和一小块可复用内容。内容可能是领域概念、工具规则、代码片段、常见失败模式或排错步骤。

[ctx-00263] helpful=3 harmful=1 :: 在认证失败时先核对用户名字段、 supervisor credentials 与 API 参数, 不要绕过权限检查。
Localization只改相关条目,不重写全文。
Attribution轨迹能引用 ID,记录条目是否有用。
Maintenance可追加、去重、更新计数与剪枝。
ACE 在 AppWorld 上生成的 playbook 示例,含策略、代码模板和排错规则
Figure 3 · ACE-generated Playbook(论文第 4 页)。示例同时保存 hard rules、可执行代码模板和 troubleshooting。它展示了“全面”在论文中的具体含义:不是增加背景描述,而是积累下一次任务可直接调用的细粒度操作知识。

表示形式解决了“旧知识放在哪里”,还需要一个更新流程解决“新经验怎样变成可信的条目”。

05 · Method

Generator、Reflector、Curator 与确定性合并

ACE 的 Generator Reflector Curator 与增量上下文更新流程
Figure 4 · ACE Framework(论文第 5 页)。Query 与当前 playbook 进入 Generator;轨迹交给 Reflector 反复诊断;Curator 只产生 delta context items;系统将 delta 合回持久 playbook。
1. Generator

携带当前 playbook 执行新 query,生成推理、工具调用或答案,并引用本次相关的 bullet ID。

2. Reflector

结合结果、ground truth 或执行反馈诊断根因,提炼可复用 insight,给旧条目标注 helpful/harmful/neutral。

3. Curator

把缺失且不重复的 insight 转成小型 delta;附录示例中输出甚至被约束为 ADD,由系统补 ID。

最容易被忽略的第四步:LLM 不负责最终合并

Curator 之后,轻量的非 LLM 逻辑把新 ID 追加到 playbook,把已有条目的计数或内容定点更新。语义 embedding 用来检测重复。多个 delta 可以并行产生再批量合并。

本文解读真正防止 collapse 的不是 Reflector 更聪明,而是权限边界改变了:三个 LLM 角色都只能提出局部候选更新,没有任何一次生成可以用 122 tokens 覆盖 18,282 tokens 的全部状态。

附录 prompt 揭示的实现约束

  • AppWorld Reflector 同时读取 trajectory、ground-truth code、unit test 和 playbook,输出错误、根因、正确路径与关键 insight。
  • Generator 被要求引用用过的 bullet ID,使“哪条知识影响了结果”可以追踪。
  • Curator 只保留缺失、非冗余且可复用的知识;长 prompt 原文没有被直接复制进报告。
06 · Adaptation Modes

Grow-and-refine,以及离线与在线两种时序

grow 负责保留新 insight,refine 负责语义去重、更新 helpful/harmful metadata,并在 context 超出阈值时剪除陈旧或低价值条目。去重可在每个 delta 后主动执行,也可在触发长度上限后惰性执行。

Offline adaptation

在训练集上构造 playbook,再固定 context 到测试集做 pass@1。最多 5 个 epoch,同一 query 可被重复访问以继续修订经验。

Online adaptation

按序处理测试样本:先用当前 context 预测,再利用这个样本的反馈更新,下一条样本立即读取新状态。

主实验统一使用 DeepSeek-V3.1 non-thinking 模式承担三个角色,batch size 为 1,Reflector 最多 5 轮。使用同一个模型是为了避免更强 Reflector 向较弱 Generator 转移能力,把收益尽量归因于 context construction。

5主设置最大 reflection rounds
5offline 最大 epochs
1每个 delta 的 batch size
10K–100K测试过的 pruning trigger 范围
07 · Experimental Design

实验不是数字陈列,而是对方法主张逐项提问

任务、反馈与实验问题
任务核心能力指标反馈条件主要问题
AppWorldAPI、代码、环境交互TGC / SGCGT 或执行成败无人工标签能否自改进
FiNER139 类 XBRL 实体AccuracyGT 或弱自反馈专业规则能否累积
Formula金融概念与数值推理AccuracyGT 或答案反馈复杂领域策略能否复用
DDXPlus / BIRD-SQL医疗 / Text-to-SQLAccuracy / LLM judgeoffline GT能否跨领域迁移

基线对应四种不同思路:ICL 塞入 demonstrations;MIPROv2 联合优化指令与示例;GEPA 用轨迹和反思做完整 prompt evolution;Dynamic Cheatsheet 在测试时累积并重写外部 memory;AppWorld 的基础 Agent 为官方 ReAct。

评估边界offline 在训练集优化、测试集评估;online 在统一打乱的测试序列上先预测再更新。GT labels = 否不代表完全没有反馈:AppWorld 仍有代码执行结果,FiNER 则缺少同样可靠的环境信号。

08 · Main Results

主结果:有效,但“无标签”有条件

AppWorld:执行反馈足以支持在线自改进

Table 1 · AppWorld 主结果,DeepSeek-V3.1-671B;数值为 TGC / SGC(%)
方法GTNormal TGCNormal SGCChallenge TGCChallenge SGC平均
ReAct63.742.941.521.642.4
Offline adaptation
ReAct + ICL64.346.446.027.346.0 +3.6
ReAct + GEPA64.944.646.030.246.4 +4.0
ReAct + ACE76.264.357.339.659.4 +17.0
ReAct + ACE75.064.354.435.257.2 +14.8
Online adaptation
ReAct + DC-CU65.558.952.330.851.9 +9.5
ReAct + ACE69.653.666.048.959.5 +17.1

直接证据在线 ACE 在 test-challenge 的 TGC / SGC 从 41.5 / 21.6 提升到 66.0 / 48.9;离线无 GT 也达到 57.2 平均。可支持的准确结论是:在 AppWorld 有执行成败可用时,ACE 不依赖人工标签仍能形成有效 playbook。

比较限制论文把 ACE 59.4 与 2025 年 9 月 AppWorld 榜单的 IBM CUGA 60.3 放在一起,但脚注明确说 CUGA 只是粗略参照,不是同设置的方法学 baseline,不能据此断言 ACE 的完整 Agent 系统优于 CUGA。

金融任务:不可靠反馈会把自进化变成自污染

Table 2 · FiNER / Formula 金融结果,DeepSeek-V3.1
方法设置GTFiNERFormula平均
Base LLMBase70.767.569.1
GEPAOffline73.571.572.5 +3.4
ACEOffline78.385.581.9 +12.8
ACEOffline71.183.077.1 +8.0
DC-CUOnline68.3 -2.462.5 -5.065.4 -3.7
ACEOnline76.776.576.6 +7.5
ACEOnline67.3 -3.478.5 +11.072.9 +3.8

无 GT online ACE 在 Formula 上提升 11.0 点,却在 FiNER 上下降 3.4 点。这一混合结果比平均值 72.9 更重要:没有 ground truth 或可靠执行信号时,模型可能把错误判断持久写入 context。

本文解读ACE 的“无标签”能力依赖自然反馈,而非依赖模型无条件相信自己。自进化系统首先要设计反馈通道,其次才是 memory 更新算法。

09 · Ablation & Robustness

哪一部分真正贡献了增益

AppWorld 四项平均从 ReAct 的 42.4 开始:没有 Reflector 和 multi-epoch 时为 55.1;加入 Reflector、但没有 multi-epoch 时为 56.8;完整 offline ACE 为 59.4。在线设置不做 offline warmup 为 56.1,加入 warmup 为 59.5。基础条目式适应已经有效,Reflector、多 epoch 和 warmup 继续累积增益。

ACE 有无 incremental update 的 AppWorld test-normal 消融结果
Appendix Table 18 · Incremental update 消融(论文第 20 页)。无增量更新时 TGC / SGC / 平均为 67.3 / 46.4 / 56.9;启用后为 76.2 / 64.3 / 70.3。相对前者,TGC 再增 8.9 点、SGC 再增 17.9 点,是论文核心机制最直接的证据。

Reflector 不必最强,但不能持续错误

Appendix Tables 16–17 · FiNER 反思质量与有害更新
条件Reflector / 污染频率Accuracy相对 Base 70.7
较弱 ReflectorGPT-OSS-120B76.6+5.9
默认 ReflectorDeepSeek-V3.178.3+7.6
更强 ReflectorGPT-5.178.5+7.8
持续有害更新每 1 step66.7-4.0
间歇有害更新每 5 steps76.1+5.4
无有害更新Never78.3+7.6

结构化条目、metadata 和去重可以缓冲偶发噪声,但每一步都注入错误时会低于 base。ACE 解决“怎样保存经验”,没有自动解决“怎样保证经验为真”。

61.31 round reflection,提炼不足
65.83 rounds
67.65 rounds,主设置
65.210 rounds,出现 overthinking
10 · Cost Analysis

适应阶段更便宜,评估阶段的 context 更长

Table 4 · 适应阶段成本与速度
场景对照ACELatency 变化额外成本指标
Offline AppWorldGEPA: 53,898 s9,517 s-82.3%Rollouts 1,434 → 357(-75.1%)
Online FiNERDC: 65,104 s5,503 s-91.5%Token cost $17.7 → $2.9(-83.6%)

离线适应时,ACE 相比 GEPA 少用 80.8% input tokens 和 83.6% output tokens。主要原因是 ACE 不执行 GEPA 的候选 prompt validation loop,并用局部 delta 代替反复全文重写。

Adaptation stage

局部更新显著减少重复生成和验证,延迟、输出 token 与 rollout 开销下降。

Evaluation stage

playbook 更长,每 query raw input tokens 相比 GEPA 增加 117.4%,不是“所有 token 都更少”。

论文在 GPT-5.1 的 OpenAI prompt caching 实验中报告 91.8% input tokens 命中 cache,使 billed input-token cost 相对按原始 token 计费降低 82.6%。

成本边界ACE 把部署端成本押注在稳定 prefix 和高 cache 复用率上。若基础设施没有等价缓存、计费不同或上下文频繁变动,raw input 增长仍会转化为首 token 延迟、显存或费用。

11 · Evidence Boundary

论文证明了什么,又没有证明什么

有直接证据

  • 知识/环境密集任务中,结构化增量 context 可优于 ICL、GEPA 与 DC。
  • incremental update 承担了 AppWorld 的大部分增益。
  • 有执行反馈时,无人工 GT 也能在线改进。
  • 持续有害反思会让性能低于 base。

论文只提示

  • 该机制可能作为 weight update 之外的 continual learning 接口。
  • 多模型正增益说明框架有迁移性,但还不是任意模型上的普遍性。
  • 可读 playbook 为 unlearning 与治理提供接口。

尚未证明

  • 长 context 对所有任务都优于简短规则。
  • 任何部署基础设施都能获得相同成本下降。
  • 条目化自动保证事实正确、无冲突或无污染。
  • 长期分布漂移和跨用户场景下仍安全稳定。

跨模型附录在 GPT-OSS-120B、GPT-5.1、Llama-3.3-70B-Instruct 上替换全部角色而不改算法,均报告增益;较弱模型提升较小。这支持“不是 DeepSeek 专属 prompt”,但也反映算法上限仍受底层模型反思能力约束。

12 · Critical Review

局限不在页面最后,而在算法闭环内部

1. 反馈质量是第一性约束

Generator 产生轨迹、Reflector 抽取 insight、Curator 形成 delta,任何系统性偏差都可能被持久保存。helpful/harmful 计数和去重主要解决组织问题,不能验证一条知识是否为真。

2. 不是所有任务都需要丰富 playbook

作者明确指出 HotPotQA 可能更需要简洁的检索与证据综合规则,Game of 24 可能只需要一条稳定策略。若模型已经掌握知识或任务规则很少,持续增长只会增加噪声和成本。

3. 长期在线学习仍缺少系统治理

论文统一样本顺序保证实验公平,但没有充分回答概念漂移、矛盾经验、跨用户隔离和过期知识。生产系统还需要来源追踪、版本回滚、冲突检测、权限边界与人工审批。

4. “可治理”是潜力,不是已完成能力

条目式 delta 确实让上述能力比权重更新更容易实现,但当前实验没有完成隐私删除、合规审计或长期安全更新。评价时应区分数据结构提供的可行性和系统已经验证的能力。

13 · Topic Map

ACE 在 AI 自进化专题中的位置

ACE 是一种 test-time / post-training 的非参数自进化:经验不写回 weights,而是写入可持续更新的外部 context。

更新对象结构化 context / playbook,而非模型权重。
反馈来源GT、执行结果、环境信号或模型反思。
更新算子Generator → Reflector → Curator → deterministic merge。
核心风险错误反馈被持久化,长 context 依赖缓存基础设施。

后续比较 TF-GRPO、AHE 与 SEAGym 时,可以沿四个坐标继续追踪:方法更新的是 weights、context、workflow/harness 还是 environment;反馈来自标签、reward、执行信号还是 self-judge;更新发生在离线、训练时还是测试时;错误更新能否定位和回滚。

最终结论:ACE 最重要的工程判断是,LLM 不应拥有覆盖全部历史状态的权限。详细经验以 itemized delta 进入系统,长期状态由确定性逻辑维护。AppWorld 与增量更新消融为这条判断提供了强证据;FiNER 无标签退化和有害 Reflector 则清楚说明它不是“无监督自动变强”的通用魔法。