# Training-Free Group Relative Policy Optimization

> **论文类型**：AI Agent 自进化 / Context-space Optimization / Training-free Adaptation  
> **作者**：Yuzheng Cai, Siqi Cai, Yuchen Shi, Zihan Xu, Lichao Chen, Yulei Qin, Xiaoyu Tan, Gang Li, Zongyi Li, Haojia Lin, Yong Mao, Ke Li, Xing Sun  
> **机构**：Tencent Youtu Lab、Fudan University、Xiamen University  
> **版本**：arXiv:2510.08191v1，2025-10-09；PDF 中未看到正式会议或期刊录用信息  
> **代码**：论文给出 `TencentCloudADP/youtu-agent/tree/training_free_GRPO`  
> **阅读定位**：本文不是把 GRPO 原封不动地搬进 prompt，而是借用“同题成组探索 + 相对比较 + 多轮更新”的结构，把优化对象从模型参数改为外部经验库。

## 0. 先用一句话理解这篇论文

Training-Free GRPO 对同一个问题采样多条 rollout，用奖励区分成功与失败轨迹，再让 LLM 比较这些轨迹并抽取自然语言形式的“语义优势（semantic advantage）”；这些优势不用于反向传播，而用于增删改外部经验库 \(\mathcal E\)，后续推理把 \(\mathcal E\) 注入 prompt，从而改变冻结模型的输出分布。

这句话里有两个需要提前限定的词。第一，`Training-Free` 指**没有梯度更新和参数训练**，不表示没有训练数据、奖励、epoch、采样成本或优化循环。第二，`GRPO` 表示方法保留了 GRPO 的组内相对比较思想，并不表示它仍在优化同一个数学目标，也不意味着自然语言经验在理论上等价于数值 advantage。

---

## 1. 为什么要把 Agent 适应从参数空间移到上下文空间

### 1.1 通用模型强，不等于拿来就能做专业 Agent

论文从一个现实矛盾出发：大型语言模型已经能进行复杂推理、搜索、编程和计算机操作，但专业任务往往还要求它理解特定任务定义、选择正确工具、遵循领域工作流，并在长链条中控制工具调用。通用模型没有经历这些特定工具和规则时，即使语言与推理能力很强，也会出现低效搜索、错误调用和领域策略缺失。

常见解决方案是 Agentic RL：通过 SFT 和 RL，把工具使用与任务策略写入参数。GRPO 及其变体尤其适合用同一问题的一组回答估计相对优势，从而避免额外 critic。然而，论文认为参数更新在真实专业场景中同时受到四类约束。

| 参数化适应的约束 | 论文的具体论据 | 推出的工程问题 |
|---|---|---|
| 计算成本 | 即使较小模型也需要大量 GPU；大模型微调更昂贵 | 许多团队只能训练 32B 以下模型，而不是能力更强的模型 |
| 泛化与部署 | 专门模型可能只在目标域表现好，每个领域还需要独立部署 | 多个低频专用模型带来维护和固定服务成本 |
| 数据稀缺 | 专业领域的高质量标注昂贵，少样本微调容易过拟合 | 训练数据最少的场景反而最需要适应能力 |
| 收益递减 | 大模型 API 往往持续更新且通用能力更强，但通常不可微调 | “可训练的小模型”与“更强但冻结的大模型”形成成本-能力矛盾 |

这里的关键不是宣称微调无效，而是改变问题：**如果一个强模型已经具备基本推理与工具能力，是否可以只学习少量可复用策略，并在调用时作为 token prior 注入，而不去重写模型参数？**

### 1.2 论文的设计假设：经验文本也能改变输出分布

作者把 in-context learning 视为一种轻量适应通道。参数更新通过改变 \(\theta\) 改变 \(\pi_\theta(y\mid q)\)；上下文更新则保持 \(\theta\) 不变，把经验 \(\mathcal E\) 加到条件中，形成 \(\pi_\theta(y\mid q,\mathcal E)\)。如果经验能稳定描述“高奖励轨迹做对了什么、低奖励轨迹错在哪里”，它也可能让后续生成偏向更高奖励的动作。

<span class="claim">论文主张</span> 强模型只需要少量练习，就可以把专业经验编码为外部 token prior；冻结参数还能避免小样本微调的过拟合和专门化损伤。

<span class="reading">本文解读</span> 这个论点包含两层强度不同的结论。实验可以直接检验“经验 prompt 是否改善这些基准”，却不能仅凭最终分数证明“它与 RL 在优化意义上等价”，也不能证明冻结参数会自动消除上下文经验造成的行为偏置。

### 1.3 研究问题与贡献顺序

论文实际回答的是三个递进问题：

1. 能否从同题多条轨迹中抽取比静态提示更有效的经验？
2. 能否跨多个 batch/epoch 维护这些经验，使冻结模型在未见测试题上持续改善？
3. 这种方式在少量数据和低频服务场景中，是否比训练并部署专用小模型更经济？

作者据此提出四项贡献：从 parameter space 转向 context space；用 semantic group advantage 替换数值 advantage；用几十到一百个样本降低学习成本；通过按域插拔经验库保留通用模型能力。后两项是实验主张，必须结合模型差异、任务范围与成本假设理解，不能仅从方法定义推出。

---

## 2. 它与 GRPO 到底相同在哪里、不同在哪里

### 2.1 Vanilla GRPO：数值优势指导参数梯度

对查询 \(q\)，vanilla GRPO 从当前策略 \(\pi_\theta\) 采样一组 \(G\) 个输出：

\[
\{o_1,o_2,\ldots,o_G\},\qquad o_i\sim\pi_\theta(o_i\mid q).
\]

奖励模型给出 \(r_i=R(q,o_i)\)，组内标准化产生相对优势：

\[
\hat A_i=\frac{r_i-\operatorname{mean}(\mathbf r)}{\operatorname{std}(\mathbf r)}.
\]

随后将 \(\hat A_i\)、PPO clipping 与相对 reference policy 的 KL 惩罚组合成 \(J_{\text{GRPO}}(\theta)\)，通过梯度上升更新模型参数。优势是数值信号，优化对象是 \(\theta\)，结果持久写入权重。

![Figure 2：Vanilla GRPO 与 Training-Free GRPO 的结构对照](./Training-Free-GRPO-论文汇报.assets/fig2-grpo-comparison.png)

*Figure 2，论文第 4 页。上半部分是参数更新，下半部分是经验控制器更新。图中真正被保留的是 group rollout、reward 和相对比较；reference model、数值 advantage、梯度目标都没有被完整保留。*

### 2.2 Training-Free GRPO：语义优势指导经验库操作

Training-Free GRPO 把参数永久冻结，维护一个初始为空的经验库 \(\mathcal E_0=\varnothing\)。第 \(t\) 轮策略变为：

\[
o_i\sim\pi_\theta(o_i\mid q,\mathcal E_t),\qquad \theta\ \text{fixed}.
\]

同一问题仍生成 \(G\) 条 rollout，并由奖励函数评分。但它不再计算用于梯度的 \(\hat A_i\)，而是先分别压缩轨迹：

\[
s_i=M(p_{\text{summary}},q,o_i,r_i,\text{ground truth}),
\]

再把同组摘要、当前经验库与可选 ground truth 交给 LLM 比较成功与失败路径，得到自然语言经验：

\[
A_{\text{text}}=M(p_{\text{extract}},q,\{s_i\}_{i=1}^{G},\mathcal E_t).
\]

一个 batch 内各组的更新建议被汇总，由 controller 生成对经验库的操作，得到 \(\mathcal E_{t+1}\)。因此，后续策略变化来自条件文本变化，而不是权重变化。

| 比较维度 | Vanilla GRPO | Training-Free GRPO | 是否严格等价 |
|---|---|---|---|
| 探索单元 | 同题 \(G\) 个输出 | 同题 \(G\) 条输出/Agent 轨迹 | 结构相似 |
| 质量信号 | scalar reward | 仍先使用 scalar reward | 基本相同 |
| 相对信号 | 标准化数值 \(\hat A_i\) | LLM 解释的自然语言 \(A_{text}\) | 表达与统计性质不同 |
| 优化对象 | 参数 \(\theta\) | 经验库 \(\mathcal E\) | 完全不同 |
| 更新机制 | 目标函数梯度 | Add/Delete/Modify/Merge/Keep | 完全不同 |
| 稳定机制 | reference policy + KL | 冻结基础模型作为强 prior | 仅为作者类比，没有等价约束 |
| 持久化方式 | 新 checkpoint | 外部文本，可按域切换 | TF-GRPO 更可插拔 |

<span class="limit">限制</span> 论文称 semantic advantage 与 \(\hat A_i\) “functionally equivalent”，更准确的说法是二者都提供更新方向。自然语言经验没有数值 advantage 的尺度、无偏性或优化目标，也没有 PPO/KL 所对应的单调改进或漂移界限。

---

## 3. 完整算法：一次 Training-Free GRPO 学习步骤如何运行

### 3.1 Step 1：用当前经验库条件化策略并成组采样

每个训练问题先与当前经验库拼接。数学任务的附录 prompt 非常直接：先要求模型仔细阅读 helpful instructions and experiences，再求解问题；ReAct 设置允许模型选择性调用 Python code interpreter。对每个问题并行生成 \(G\) 条轨迹，这些轨迹不仅包含最终答案，也包含推理、工具调用和工具返回。

数学实验使用 DAPO-100，3 epochs、每个 epoch 一个 batch，总计 3 个学习步骤；训练温度 0.7，group size \(G=5\)。Web 搜索使用 AFM-100，同样 3 epochs，但 \(G=3\)。这意味着“多 epoch”不是在同一批参数上反复反向传播，而是让上一轮整理出的经验进入下一轮 rollout。

### 3.2 Step 2：奖励与可学习组筛选

每条 rollout 获得标量奖励。在有 ground truth 的默认版本中，数学题可以依据正确答案区分成功和失败；Web 任务也使用相应评测信号。论文遵循 vanilla GRPO 的一个直觉：如果同组所有轨迹奖励相同，\(\operatorname{std}(\mathbf r)=0\)，数值 advantage 本来也为零，因此 TF-GRPO 只对同时包含 clear winners 与 losers 的组抽取 semantic advantage。

这个筛选提高了对比信号的清晰度，但也带来盲点：如果整组都错，方法不会从“共同失败模式”中产生更新；如果整组都对，也不会继续提炼更短、更稳健或更低成本的策略。它依赖采样多样性先产生可比较差异。

### 3.3 Step 3：逐轨迹摘要，保留动作、经验引用与错误位置

长 Agent 轨迹不能直接无结构地拼到比较器中。附录 Figure 11 的 trajectory summarization prompt 要求逐步说明：执行了什么动作、用了哪条经验；结合评分和正确答案定位 detour、error、backtracking；即使某一步属于错误路径，也保留其核心产出。摘要 \(s_i\) 因而承担了 credit assignment 的中间表示。

<span class="reading">本文解读</span> 摘要器决定后续比较器看见什么。若它误删关键工具输出或把结果归因给错误经验，semantic advantage 会继承偏差。论文没有单独消融摘要器质量，也没有比较不同摘要模型或压缩长度。

### 3.4 Step 4：比较组内赢家与输家，形成 semantic advantage

组比较 prompt 不只是让模型“反思失败”，而是要求同时分析成功步骤、错误位置、被遗漏或不足的旧经验，并把结论转成对经验库的修改建议。每条建议要说明适用场景、问题特征和可迁移模式；它可以提出 `modify`、`add` 或 `delete`，也可以保持不变。

![Figure 3：组内轨迹比较如何产生自然语言经验](./Training-Free-GRPO-论文汇报.assets/fig3-learning-step.png)

*Figure 3，论文第 5 页。示例把同一几何题的错误和正确轨迹先分别摘要，再抽取“有界区域交点必须验证几何约束”的经验。它直观展示 semantic advantage 的载体，但单个示例不能证明经验一定跨题泛化。*

这一设计与普通 self-reflection 的差别在于**对比来源**：反思一条失败轨迹容易得到宽泛建议；同题赢家与输家共享题目条件，差异更接近“哪些决策导致奖励不同”。数学消融中把 \(G\) 从 5 降为 1 后，AIME25 从 73.3 降至 69.3，为 group-relative comparison 的必要性提供了直接证据。

### 3.5 Step 5：汇总一个 batch 的建议，更新经验库

论文的“经验更新操作”有三种并不完全一致的口径，复现时不能把它们简单取并集。正文抽象写成四类：

- `Add`：加入库中缺失的新策略；
- `Delete`：删除低质量或被反证的经验；
- `Modify`：修正适用条件不足或表达不清的经验；
- `Keep`：证据不足时保持原库。

实际 prompt 又分成两层。Figure 12 的单题 group-advantage prompt 允许 `Modify / Add / Delete` 或保持不变；Figure 13 的最终 batch optimization prompt 只允许 `Modify / Merge / Delete` 或保持不变，并没有 `Add`。后者要求最终经验不超过 32 个英文词，以一般背景开头，聚焦策略性决策而不是具体计算，并避免重复；但 Appendix Figure 14 展示的部分最终经验看起来超过了这一长度，因此该约束并非严格执行保证。这个批处理层很重要：单个问题先产生局部更新建议，batch controller 再把建议整理成跨问题可复用、不会无限膨胀的公共经验库。

### 3.6 Step 6：下一轮重新 rollout，最终把经验当作 token prior

更新后的 \(\mathcal E_{t+1}\) 会进入下一 batch 或下一 epoch 的 prompt。三轮结束后，不需要部署新 checkpoint，只需在测试调用中附加相应领域经验。论文数学实验最终得到 48 条工具使用经验，内容包括有界区域验证、坐标方向解释、不变量的小样例反证、质数枚举顺序以及求解后完整约束检查。

![Figure 14：数学任务中学到的经验片段](./Training-Free-GRPO-论文汇报.assets/fig14-learned-experiences.png)

*Figure 14，论文第 23 页。经验是短的条件化策略，不是训练题答案或完整 demonstration。图中经验的粒度并不完全一致：有些高度一般化，有些仍绑定特定数学结构，这也意味着经验检索与冲突管理会影响更大规模应用。*

### 3.7 算法伪代码

```text
input: frozen LLM πθ, reward R, training queries D
state: experience library E ← ∅

for epoch = 1 ... K:
    suggestions ← []
    for q in D:
        O ← { rollout πθ(q, E) } × G
        rewards ← { R(q, oi) for oi in O }
        if rewards contain both winners and losers:
            summaries ← { summarize(q, oi, ri, ground_truth) }
            case_ops ← compare_group(q, summaries, E, ground_truth)
                       # Figure 12: add / modify / delete / no-op
            suggestions.append(case_ops)
    E ← batch_controller(E, suggestions)
        # Figure 13: modify / merge / delete / no-op

return E

inference(q*): return πθ(q*, E)
```

这段伪代码暴露了一个重要事实：它仍然是一种**离线经验学习**。训练集与测试集分开，多轮学习只发生在训练问题上，测试时冻结经验库进行推理；“training-free”只是训练对象不再是模型权重。

---

## 4. 与相邻方法的真正边界

### 4.1 相比 Self-Refine、Reflexion 与 TextGrad

Self-Refine 和 Reflexion 通常围绕单个样本进行反馈与重试；TextGrad 把语言反馈沿结构化计算图传播。TF-GRPO 强调两个区别：它在独立训练集上跨样本积累共享经验，并且每个问题显式比较多条 rollout，而不是只批评一条轨迹。其目标不是把当前答案改好，而是形成以后问题都可调用的经验库。

### 4.2 相比 in-context RL

ICRL 把过去输出与 scalar reward 放进上下文，让模型从奖励序列中调整行为。TF-GRPO 没有直接把大量历史 rollout 原样保留，而是用 LLM 将组内差异压缩成可读经验，再跨 epoch 更新。这更节省上下文，也更可解释，但引入了摘要、归因和经验合并三个额外误差源。

### 4.3 相比 Agent KB 与普通经验提示

Agent KB 使用层次化知识库和 reason-retrieve-refine 流程；TF-GRPO 的测试时机制更简单：直接把已学经验注入 prompt。它与“让模型事先列几条解题建议”的核心区别不是载体，而是**经验的生成过程**。数学 Table 2 明确控制 directly generated experiences 与 TF-GRPO 的经验数量相同，结果仍下降；Web Table 5 也报告直接经验的负 pass@1，但原文没有说明它是否匹配经验数量。因此数学消融较强地支持“奖励约束的对比学习优于等量静态建议”，Web 结果只能说明该直接经验基线没有改善当前设置。

### 4.4 与 ACE 的关系

二者都把可进化状态放在模型外部，但关注点不同。ACE 主要研究长期 playbook 如何增量维护、去重与避免 context collapse；TF-GRPO 主要研究如何从同题多 rollout 的奖励差异生成经验更新信号。可以把 TF-GRPO 看作“如何产生相对经验梯度”，把 ACE 看作“如何维护不断增长的上下文状态”。这种类比有助于组合方法，但不是论文已经实验验证的组合系统。

---

## 5. 实验到底在检验什么

### 5.1 两个领域、两个独立经验库

| 研究问题 | 训练数据 | 测试基准 | 策略与工具 | 学习设置 | 主要指标 |
|---|---|---|---|---|---|
| 少量数学经验能否迁移到竞赛题 | 从 DAPO-Math-17K 随机采样 100 题 | AIME24、AIME25 | Direct；ReAct + code interpreter | 3 epochs，单 batch/epoch，训练 T=0.7，\(G=5\)；测试 T=0.3 | 32 次独立运行的平均 Pass@1，记作 Mean@32 |
| Web 交互经验能否迁移到新搜索题 | 从 AFM Web RL 数据随机采样 100 queries | WebWalkerQA | ReAct + Web tools | 全集主实验 3 epochs，\(G=3\)；Table 5 的 51 题消融统一只优化 2 epochs | pass@1；51 题子集还报告 pass@3 |

这里的 OOD 是指训练数据来自 DAPO 或 AFM，而评测来自 AIME 与 WebWalkerQA。它证明的是跨数据集迁移，不等于跨任意领域迁移。数学经验和 Web 经验是按域分别学习、分别插入的，并不是同一个混合经验库自动选择所有领域策略。

### 5.2 模型范围

主实验使用 DeepSeek-V3.1-Terminus；数学还测试 DeepSeek-V3.2-Exp、Qwen3-32B non-thinking 与 Qwen2.5-72B；Web 子集测试 QwQ-32B。强模型是论文的目标使用场景，因为其权重通常难以低成本更新。与此同时，跨模型结果也是最重要的边界证据：方法在数学模型上普遍小幅正向，但在复杂 Web 工具任务的 QwQ-32B 上出现负迁移。

---

## 6. 数学推理：主结果支持“少量经验能改善冻结强模型”

### 6.1 AIME 主结果

| 方法 | 模型 | 工具 | 学习成本 | AIME24 | AIME25 |
|---|---|---:|---:|---:|---:|
| Direct | DeepSeek-V3.1-Terminus | - | - | 68.6 | 52.9 |
| + TF-GRPO | 同上 | - | 约 $8 | **72.6 (+4.0)** | **54.0 (+1.1)** |
| ReAct | DeepSeek-V3.1-Terminus | CI | - | 80.0 | 67.9 |
| + TF-GRPO | 同上 | CI | 约 $18 | **82.7 (+2.7)** | **73.3 (+5.4)** |
| ReAct | DeepSeek-V3.2-Exp | CI | - | 71.0 | 61.8 |
| + TF-GRPO | 同上 | CI | 约 $8 | **73.1 (+2.1)** | **63.2 (+1.4)** |

<span class="evidence">直接证据</span> 在相同 DeepSeek 模型与相同推理框架内部，加入 TF-GRPO 经验后六个主对比全部上升。最明显的是 DeepSeek-V3.1-Terminus + ReAct 的 AIME25，从 67.9 提升到 73.3，绝对提升 5.4 点。

<span class="reading">本文解读</span> 同模型前后对比可以支持“经验库改变并改善当前基准行为”。它不能单独支持“优于参数 RL”这一更强结论，因为后者的表格使用 Qwen2.5-32B，而 TF-GRPO 使用能力显著更强的 DeepSeek-V3.1-Terminus。

### 6.2 三轮学习动态：成绩上升，工具调用下降

![Figure 4：三步学习中的训练/测试表现与工具调用数](./Training-Free-GRPO-论文汇报.assets/fig4-learning-dynamics.png)

*Figure 4，论文第 6 页。训练集 Mean@5 和 AIME Mean@32 随三个 learning steps 上升，AIME24/25 的平均工具调用数下降。图支持多步经验更新与更精简工具使用相关，但只有三个点、没有误差条，也没有单独控制经验长度变化。*

作者据此认为，经验不仅教模型答对，也教模型避开冗余工具调用。这个结论有一定证据，但应注意图中 `Mean@32` 是 32 次采样的平均 Pass@1，不是传统意义上的 pass@32；工具调用减少也不必然意味着真实延迟和 token 成本同步下降。

### 6.3 小模型/不同规模模型

| 模型 | ReAct AIME24 → TF-GRPO | ReAct AIME25 → TF-GRPO |
|---|---:|---:|
| Qwen3-32B non-thinking | 29.1 → **33.5 (+4.4)** | 19.5 → **25.4 (+5.9)** |
| Qwen2.5-72B-Instruct | 13.5 → **14.9 (+1.4)** | 9.6 → **11.4 (+1.8)** |
| DeepSeek-V3.1-Terminus | 80.0 → **82.7 (+2.7)** | 67.9 → **73.3 (+5.4)** |

这些结果说明数学经验机制并非只在单一模型上有效。但 Qwen2.5-72B 的基线很低且提升很小，说明参数量本身不是条件，基础模型的推理风格、instruction following 和工具能力可能更关键。

---

## 7. 数学消融：哪一部分真的贡献了增益

| DeepSeek-V3.1 + ReAct 设置 | AIME24 | AIME25 | 相对基线的含义 |
|---|---:|---:|---|
| 无经验基线 | 80.0 | 67.9 | 起点 |
| 直接生成同数量经验 | 79.8 | 67.3 | **两项均下降**，静态自我建议不够 |
| TF-GRPO，无 ground truth | 80.7 | 68.9 | 仍有 +0.7/+1.0，但明显弱于完整版 |
| TF-GRPO，\(G=1\) | 80.4 | 69.3 | 单轨迹蒸馏只有 +0.4/+1.4 |
| 完整 TF-GRPO，\(G=5\) | **82.7** | **73.3** | 最佳，ground truth 与组比较共同重要 |

### 7.1 直接生成经验为什么是负结果

论文让 DeepSeek 直接生成与 TF-GRPO 数量相同的经验，但数学成绩从 80.0/67.9 略降到 79.8/67.3。这排除了“只是多放一些领域提示就会变好”的解释，也说明未经实证对比的经验可能干扰强模型。

### 7.2 没有 ground truth 还能不能学

没有正确答案时，比较器只能依赖多数投票、自判别和反思，AIME 仍比基线高 0.7/1.0 点。它说明方法在无标准答案时不是完全失效，但“robustness to reward signal”不应解读为不需要可靠奖励：完整版相对无 GT 版本又高 2.0/4.4 点，ground truth 是主要增益来源之一。

### 7.3 为什么 group-relative 不是命名装饰

把 \(G\) 设为 1 后 AIME25 从 73.3 降至 69.3。单条轨迹仍可总结经验，因此这 4.0 点差异是论文对“赢家-输家对比比单轨迹反思更有效”的最直接支持。不过实验只比较 1 与 5，没有 group size 曲线，无法判断最优组规模与额外采样成本的关系。

---

## 8. Web 搜索：有正结果，也暴露基础模型门槛

### 8.1 WebWalkerQA 全集主结果

DeepSeek-V3.1-Terminus + ReAct 的 pass@1 为 63.2；加入从 AFM-100 学到的经验后达到 67.8，提升 4.6 点。附录案例显示，经验让模型优先打开官方来源、从宽泛查询逐步缩小到正式标题，并在回答前验证两个数值，修正了只读搜索摘要、遇到连接失败后反复宽搜的行为。

<span class="evidence">直接证据</span> 该同模型对比支持经验能改善 WebWalkerQA 的单次成功率；案例也给出可解释的行为变化：官方源优先、迭代改写查询、部分匹配核验。

<span class="limit">限制</span> 主结果只给一个总体 pass@1 数值，没有方差、显著性检验、按难度分解或工具调用/延迟统计。案例能说明可能机制，不能证明总体 4.6 点都来自这些经验。

### 8.2 51 题子集消融中的混合结果

Table 5 的所有消融模型都在 **2 epochs** 后评测，而不是复用全集主结果的 3-epoch 设置。因此子集表适合比较其内部变体，不能把数值直接当作主实验第三轮后的结果。

| 模型与方法 | pass@1 | pass@3 | 结论 |
|---|---:|---:|---|
| QwQ-32B + ReAct | 27.5 | 43.1 | 基线 |
| QwQ-32B + TF-GRPO | **25.5** | 45.1 | pass@1 **下降 2.0**，pass@3 +2.0 |
| DeepSeek-V3.1 + ReAct | 66.7 | 74.5 | 子集基线 |
| + 直接生成经验 | **64.7** | 76.5 | pass@1 下降，pass@3 上升 |
| + TF-GRPO，无 ground truth | 66.7 | **78.4** | pass@1 无提升，pass@3 +3.9 |
| + 完整 TF-GRPO | **68.6** | **78.4** | pass@1 +1.9，pass@3 +3.9 |

这张表是理解方法边界的关键。它显示：

- 经验优化更容易提高多次尝试至少一次成功的概率，而不一定提高第一次成功率；
- 没有 ground truth 时，DeepSeek 的 pass@1 完全没有改善；
- QwQ-32B 的 pass@1 反而降低，说明较弱的 reasoning/tool-use 基座可能无法正确解释和执行经验；
- 直接生成经验再次造成 pass@1 负迁移，说明经验质量控制比经验数量更重要。

因此，TF-GRPO 不是一个与模型能力无关的通用外挂。它把部分学习职责交给同一个或同类 LLM 完成摘要、比较、控制与执行，基础模型越难准确完成这些元任务，经验库越可能成为噪声。

---

## 9. “跨域泛化更强”需要怎样解读

论文 Table 6 汇总了以下结果：

| 方法（基础模型） | 学习领域 | AIME24 | AIME25 | WebWalker |
|---|---|---:|---:|---:|
| ReAct（Qwen2.5-32B-Instruct） | 无 | 29.6 | 23.1 | 31.9 |
| ReTool（Qwen2.5-32B-Instruct） | Math | 67.0 | 49.3 | 18.3 |
| MiroThinker（Qwen3-32B） | Web | 43.5 | 36.8 | 53.6 |
| TF-GRPO（DeepSeek-V3.1-Terminus） | Math / Web | **82.7** | **73.3** | **67.8** |

<span class="claim">论文主张</span> 参数微调会造成领域专门化，TF-GRPO 保持基础模型冻结，并按域插拔经验，因此能同时在数学与 Web 上取得强性能。

<span class="evidence">直接证据</span> ReTool 的 WebWalker 只有 18.3，低于 Qwen2.5 ReAct 的 31.9；MiroThinker 在数学上也弱于其 Web 表现。TF-GRPO 对应系统在三个测试上分数最高。

<span class="reading">本文解读</span> 该表不能严格证明差异来自“参数空间 vs 上下文空间”，因为方法使用了不同基础模型：DeepSeek-V3.1-Terminus 的无经验数学基线本身已达 80.0/67.9，明显高于 Qwen2.5 的 29.6/23.1。TF-GRPO 还对数学和 Web 使用不同经验库，而不是证明一个经验库跨域不干扰。更稳妥的结论是：**冻结强通用模型并切换小型领域经验库，是一种有吸引力的多域部署模式；论文尚未通过同基座、同预算、跨域注入实验隔离其泛化优势。**

作者在 Introduction 中使用“fully preserves the generalization power”这一强表述也需要收窄。冻结权重确实避免永久破坏参数，但错误或错域经验仍能在单次调用中改变输出；Web 上的 QwQ 负结果和直接经验负结果已经说明 context-space 更新也会产生负迁移。

---

## 10. 成本分析：便宜的是适应阶段，不一定是每次推理

### 10.1 学习成本

作者复现 ReTool 在 Qwen2.5-32B 上的训练，估算需要约 20,000 GPU-hours；按 $0.5/GPU-hour 计，总成本约 $10,000。TF-GRPO 在 DeepSeek-V3.1-Terminus 上只做 100 样本、3 个学习步骤，约 6 小时，消耗 38M input tokens 与 6.6M output tokens，按 DeepSeek 官方价格估算约 $18。

这清楚表明：对于不可微调的大模型 API，经验学习的启动成本远低于重新训练一个 32B Agent 模型。但两者不是同模型、同硬件和同最终服务，因此“低两个数量级”是工程方案比较，不是纯算法训练效率比较。

### 10.2 推理成本与流量前提

| 部署方式 | 作者估算的单题成本 | 固定成本 | 更适合的负载 |
|---|---:|---|---|
| ReTool-32B，4 GPU + vLLM batching | 约 $0.005 | 需要持续 GPU 服务 | 高且稳定的请求量 |
| DeepSeek API + TF-GRPO | 约 $0.02 | 无专用集群 | 低频、波动、按量付费 |

TF-GRPO 每个请求平均使用约 60K input 与 8K output tokens，作者假设大量上下文可命中低价 cache。其单题变量成本实际上约为专用小模型的四倍，优势来自不必维持闲置 GPU，而不是每次推理更便宜。因此成本结论必须带上三个条件：调用量低或不稳定、API 服务可用、经验与 ReAct 历史能获得较高 cache hit。

<span class="limit">限制</span> 论文没有给出经验库本身占多少 token、cache hit 的实测比例、不同请求量下的 break-even point，也没有把网络延迟和 API 价格变化纳入敏感性分析。

---

## 11. 附录案例解释了经验怎样改变动作

### 11.1 几何题：从局部算式修正到约束验证

无经验 Agent 把矩形 EFGH 的垂直方向设错，反复更换点顺序和参数化，最后得到约 106.91 的伪解，却没有完整检查矩形尺寸、共线顺序和共圆条件。加入经验后，它先固定 D-E-C-F 顺序，令 \(CE=x\) 且 \(0<x<107\)，统一推出 \(DE=107-x\)、\(CF=184-x\)，再选择正确的垂直方向，并用边界过滤二次方程的额外根，最终得到 \(CE=104\) 并逐项验证。

该案例最有价值之处不是“经验告诉了答案”，而是几条经验分别充当决策门：解释方向语义、统一线段参数、过滤区间外根、完成全约束验证。它说明经验可以改变 Agent 的过程结构，而不只是补充事实知识。

### 11.2 Web 搜索：从搜索摘要依赖到官方来源核验

无经验 Agent 已从摘要中看到“100 ILV per week”，但因为没有打开对应官方文章而不敢确认，只完成了 200,000 ILV / six months 的另一半答案。经验引导后，它优先定位 Illuvium 官方页面，依据正式标题缩小查询，打开 Creator Program 升级公告，最终同时核实 creators 每周 100 ILV 与 PB4 六个月 200,000 ILV。

这个案例对应的经验包括 primary-source prioritization、formal-title identification、iterative query refinement 和 partial-match evaluation。它与总体 Web 结果形成机制一致性，但仍属于作者选择的成功案例，没有展示经验导致搜索路径变差的样例。

---

## 12. 论文证明了什么、暗示了什么、没有证明什么

### 12.1 被实验较好支持的结论

- 在 DeepSeek-V3.1-Terminus 上，100 个训练样本学到的经验能提高 AIME 与 WebWalkerQA，同模型前后对比成立。
- 组内成功/失败轨迹比较比直接生成经验和单轨迹蒸馏更有效，数学消融提供直接支持。
- ground truth 显著增强经验质量；无 GT 版本有时仍改善 pass@3 或带来小幅数学提升。
- 外部经验库可以在不训练 checkpoint 的情况下插拔，学习启动成本低，适合 API 模型和低频业务。
- 学到的经验具有可读性，附录案例能把具体经验与行为改变对应起来。

### 12.2 合理但证据仍有限的推断

- 多 epoch 的经验更新可能形成一种 context-space policy iteration；Figure 4 显示三步上升，但只有三个点且没有更多 epoch 或重复种子的稳定性分析。
- 冻结大模型可能减少小数据参数过拟合；论文没有同一基础模型上的微调对照，无法单独验证这一机制。
- 按域经验库比多个专用 checkpoint 更易维护；论文没有报告经验库版本管理、冲突、检索和长期增长实验。

### 12.3 当前实验没有证明的强结论

- semantic advantage 与数值 GRPO advantage 在数学目标、收敛或稳定性上等价；
- TF-GRPO 普遍优于 RL，因为跨方法对比混合了模型规模与基础能力；
- 冻结参数就“完全保留”泛化，因为上下文经验仍可能造成负迁移；
- 方法适用于弱模型或任意工具环境，QwQ Web 结果已经构成反例；
- $18 vs $10,000 能推广到所有流量，推理阶段 TF-GRPO 的单题成本反而更高。

---

## 13. 局限性与可复现风险

论文正文没有单列 `Limitations` 章节，以下边界来自方法细节、消融和成本数据，而不是作者明确列出的完整清单。

### 13.1 基础模型同时扮演学习器和执行器

同一类 LLM 负责 rollout、轨迹摘要、组比较、经验控制和最终执行。它既要发现自己的错误，又要生成能纠正自己的规则，容易出现自我确认偏差。QwQ-32B 的 Web 负结果说明元认知能力与工具能力是前提，而不是方法自动提供的能力。

### 13.2 经验库缺乏显式目标与冲突管理

控制器通过语言判断执行增删改合并，没有可计算的全局目标、单调改进保证或回滚准则。经验被限制为短句可以减少膨胀，却可能丢失适用条件；跨样本的建议也可能冲突。论文只展示 48 条数学经验，没有研究数百或数千条经验时的检索、顺序效应和上下文上限。

### 13.3 学习信号仍依赖奖励质量

无 GT 消融的提升明显缩小，Web pass@1 甚至不变。只要 reward、judge 或多数投票误判，semantic advantage 会把错误解释固化为经验。全组同分时直接跳过，也会遗漏共同失败与高分组中的效率优化机会。

### 13.4 评测范围窄且统计报告不足

实验覆盖数学和 Web 两个领域，主训练集都只有 100 条，这是数据效率亮点，也限制了任务多样性。论文没有报告多个数据采样种子、置信区间或显著性检验；Web 消融仅 51 条。AIME 使用 32 次采样平均能降低生成随机性，但不等于独立训练重复。

### 13.5 “跨域”与“成本”比较存在混杂因素

跨域表把不同基础模型、参数规模和训练方案并列；成本表把大模型 API 按量服务与 32B 自托管集群比较。这些对工程决策有参考价值，却不能作为同预算算法对照。更有说服力的实验应在同一开放模型上比较 LoRA/SFT、GRPO、静态经验、TF-GRPO，并同时核算训练、上下文、推理与部署成本。

---

## 14. 对 AI 自进化研究的意义

TF-GRPO 把“自进化”拆成了一个可观察闭环：**行动产生多条轨迹，奖励制造差异，语言模型把差异解释成经验，经验再改变下一轮行动。** 它的价值不在于重新发明 GRPO，而在于说明 group-relative 信号可以脱离梯度，成为外部认知状态的更新规则。

这一范式适合以下条件：基础模型已经足够强但不能或不值得微调；任务能产生可比较 reward；经验可以用短自然语言表达；服务请求低频或跨多个领域；团队希望经验可审计、可插拔、可回滚。相反，当基础模型工具能力弱、奖励噪声大、任务规则难以语言化、推理吞吐高且上下文昂贵时，参数训练或更结构化的 memory/retrieval 系统可能更合适。

后续研究最值得补的不是再换更多 benchmark，而是四个机制问题：经验库在长期运行中如何去重和处理冲突；如何给 semantic advantage 设计可验证的接受/回滚门；如何分离 actor、critic、curator 以减少自我确认；如何在同基础模型和同总预算下公平比较 context-space 与 parameter-space adaptation。

---

## 15. 最终判断

<span class="claim">论文主张</span> Training-Free GRPO 把 policy optimization 从参数空间迁移到上下文空间，以少量样本和低学习成本改善冻结大模型 Agent，并保留跨域通用能力。

<span class="evidence">直接证据</span> DeepSeek-V3.1-Terminus + ReAct 在 AIME24/AIME25 从 80.0/67.9 提升到 82.7/73.3，WebWalkerQA 从 63.2 提升到 67.8；直接经验和 \(G=1\) 消融明显更弱；学习阶段约 100 样本、3 steps、$18。

<span class="reading">本文解读</span> 论文最扎实的创新是 **group-relative trajectory comparison → textual experience update**。它把普通反思提升为有对照组、有奖励约束、可跨样本积累的经验学习。把它称为“受 GRPO 启发的外部经验优化”比称为“无训练的 GRPO 等价物”更准确。

<span class="limit">限制</span> 方法依赖强基础模型与可靠奖励；QwQ Web pass@1 下降、无 GT Web pass@1 不增、直接经验两域负迁移。跨域与成本对比还混入不同模型和部署方式，论文也没有长期经验库稳定性或优化保证。

因此，这篇论文为 AI 自进化提供了一个成本低、解释性强、容易接入 API 模型的实用原型；它证明了上下文经验可以成为有效的适应状态，但尚未证明 context-space optimization 可以普遍替代 parameter-space RL。
