☰ 目录
AI Agent Self-EvolutionarXiv:2510.08191v1 · 2025-10-09

Training-Free Group Relative Policy Optimization

不改权重,用同题多轨迹的成功/失败差异学习一套可插拔经验,能否获得类似 policy optimization 的行为变化?

作者
Yuzheng Cai, Siqi Cai, Yuchen Shi, Zihan Xu 等,Youtu-Agent Team
机构
Tencent Youtu Lab、Fudan University、Xiamen University
版本
23 页 arXiv 预印本;PDF 中未看到正式会议或期刊录用信息
任务
AIME24/25 数学推理;WebWalkerQA Web 搜索
TF-GRPO 保留 GRPO 的“同题成组探索与相对比较”,却把数值 advantage 和参数梯度改成自然语言 semantic advantage 与经验库操作。它是受 GRPO 启发的 context-space optimization,不是数学上等价的免训练 GRPO。
Section 00

先建立正确心智模型

对同一个问题采样多条 rollout,用奖励区分成功与失败轨迹,再让 LLM 比较这些轨迹并抽取“哪些动作导致高奖励”的自然语言经验;经验不进入反向传播,而是增删改外部经验库 E,下一轮推理把它作为 token prior 注入。

被保留的 GRPO 结构

同题 group rollout、scalar reward、组内相对比较、多轮更新。

被替换的优化机制

数值 advantage → 语义经验;参数 θ → 外部经验库 E;梯度 → 文本操作。

“Training-Free”的准确含义

没有参数训练,但仍需要训练集、ground truth 或 reward、采样、3 epochs 和 API 成本。

最重要的边界

semantic advantage 提供更新方向,却没有 GRPO 目标函数、KL 约束或收敛保证。

本文解读这篇论文最值得学习的不是命名,而是 group-relative trajectory comparison → textual experience update:把普通单轨迹反思变成有对照、有奖励约束、可跨样本累积的经验学习。

Section 01 · Introduction

为什么专业 Agent 需要适应,但未必适合改权重

大型语言模型已经具备推理、搜索、编程和计算机操作能力,但专业任务通常还要求理解特定任务定义、选择正确工具、遵循领域工作流,并在长链条中控制 API 调用。通用模型缺少这些规则和工具经验时,常出现错误调用、低效搜索与策略缺失。

Agentic RL 通过 SFT 和 RL 把这些行为写入参数;GRPO 又能通过同题多回答估计相对优势而省去 critic。论文没有否认这种路线有效,而是指出它在大量真实业务中受到四种约束。

计算与固定部署成本

大模型微调成本高,专用 checkpoint 还需要独立服务。低频任务为闲置 GPU 持续付费并不经济。

领域专门化风险

参数优化可能缩窄模型行为;多个领域分别训练、部署和维护多个专家,系统复杂度随之增长。

高质量数据稀缺

专业标注昂贵,少样本恰恰更易过拟合,形成“最需要适应的任务最缺训练数据”的矛盾。

模型能力与可训练性的错位

预算迫使团队训练 32B 以下模型;更强的 API 大模型持续更新、成本性能更好,却通常无法微调。

由此出现论文的研究问题:如果强模型已具备基本推理和工具能力,能否只从少量练习中学习可复用策略,把它们作为 token prior 注入,而不重写参数?形式上,参数更新改变 πθ(y|q);上下文更新保持 θ 不变,把条件改成 πθ(y|q,E)

论文主张冻结权重可以避免少样本微调的过拟合与专门化损伤,并让不同领域只需切换经验库。

限定冻结参数只能保证 checkpoint 没被永久改写,不能保证注入的经验永远不造成负迁移。论文自己的直接经验与 QwQ Web 结果已经表明,context-space 更新同样可能让行为变差。

因此,方法要证明的不只是“prompt 有用”,而是同题相对比较能否产生比静态提示更可靠的经验,并在跨 epoch、跨未见题目时持续改善。

Section 02 · Method Mapping

与 Vanilla GRPO 的映射:结构相似,不是目标等价

Vanilla GRPO:数值优势指导参数梯度

对查询 q,策略 πθ 采样 G 个输出,奖励模型产生 ri,再以组内均值和标准差计算相对优势。优势进入 PPO-clipped objective,并配合 reference model 的 KL 惩罚更新 θ。

rollout: oᵢ ~ πθ(oᵢ | q), i = 1...G reward: rᵢ = R(q, oᵢ) advantage: Âᵢ = (rᵢ - mean(r)) / std(r) update: θ ← gradient_ascent(J_GRPO(θ))

Training-Free GRPO:语义优势指导经验操作

模型参数永久冻结,经验库 E 初始为空。同题仍成组采样并评分,但每条轨迹先被压缩成摘要,LLM 再比较赢家和输家,解释成功/失败原因并输出自然语言建议 Atext。一个 batch 的建议由 controller 汇总成对 E 的操作。

conditioned rollout: oᵢ ~ πθ(oᵢ | q, Eₜ), θ fixed summarize: sᵢ = M(p_summary, q, oᵢ, rᵢ, ground truth) semantic advantage: A_text = M(p_extract, q, {sᵢ}, Eₜ) update: Eₜ₊₁ ← controller(Eₜ, {A_text})
Vanilla GRPO 与 Training-Free GRPO 的结构对照图
Figure 2,论文第 4 页。上半部分通过 advantage 更新 policy model;下半部分保留 rollout 与 reward,把更新回路改接到 experiences 与 controller。
图直接展示group rollout 与 relative computation 被保留,最终可变状态从参数变为经验。
图没有证明冻结模型等价于 KL 约束,或自然语言优势具有数值优势的优化性质。
维度Vanilla GRPOTraining-Free GRPO判断
探索单元同题 G 个输出同题 G 条回答/Agent 轨迹结构相似
质量信号scalar reward仍先使用 scalar reward基本相同
相对信号标准化数值 ÂᵢLLM 解释的 Atext表达与统计性质不同
优化对象参数 θ经验库 E完全不同
更新机制目标函数梯度Add / Modify / Delete / Merge / Keep完全不同
稳定机制reference policy + KL冻结基础模型作为 strong prior只是作者的功能类比
部署形态新 checkpoint可切换的外部文本后者更可插拔、可审计
Section 03 · Full Algorithm

一次学习步骤:从成组 rollout 到经验库更新

01 CONDITION把当前经验库 E 注入 query,形成 πθ(o|q,E)。
02 ROLLOUT × G同一问题并行生成多条推理与工具轨迹。
03 REWARD + FILTER评分;只保留同时含 winner 与 loser 的组。
04 SEMANTIC ADVANTAGE逐轨迹摘要,再比较成功与失败差异。
05 OPTIMIZE E先形成逐题更新建议,再做 batch revision。

1. 条件化采样:经验进入 prompt,不进入权重

数学任务 prompt 要求模型先阅读 helpful instructions and experiences,再求解问题;ReAct 设置允许选择性调用 Python code interpreter。数学使用 DAPO-100、3 epochs、每个 epoch 一个 batch、训练温度 0.7、G=5;Web 使用 AFM-100、3 epochs、G=3。

2. 只从有相对差异的组学习

若同组所有轨迹奖励相同,vanilla GRPO 的标准差为零,论文也不生成 semantic advantage。这能减少没有对比依据的更新,却会遗漏“全组都错”的共同失败模式,也不能从“全组都对”中继续学习更短或更低成本的策略。

3. 逐轨迹摘要承担 credit assignment

附录 prompt 要求逐步记录动作、使用了哪条经验、哪里发生 detour、error 或 backtracking,并保留错误步骤的核心产出。摘要让长 Agent 轨迹可以成组比较,也决定比较器最终看见哪些因果线索。

遗漏实验论文没有单独消融摘要器,也未比较摘要模型与长度。错误压缩或错误归因会直接污染后续 semantic advantage。

4. 同题赢家-输家比较产生语义优势

比较器同时分析成功决策、错误位置、被遗漏或不足的旧经验,并为新经验说明适用场景和可迁移问题模式。与单条失败轨迹的泛泛反思相比,同题轨迹共享问题条件,行为差异更接近奖励差异的原因。

组内错误和正确轨迹经摘要后产生自然语言经验
Figure 3,论文第 5 页。几何题的错误与正确轨迹分别摘要后,比较器抽取“有界区域交点必须验证几何约束”的通用经验。
图直接展示semantic advantage 是对相对成功原因的语言化归纳,而不是对单条答案的修辞性反思。
图没有证明该经验一定跨题有效;跨题效果仍要看主实验与组计算消融。

5. 两层 Prompt 使用不同更新接口

来源允许操作作用
正文算法抽象Add / Delete / Modify / Keep概念层描述经验库可发生的变化
Figure 12:单题 group advantageAdd / Modify / Delete / no-op从同题赢家与输家形成局部更新建议
Figure 13:batch optimizationModify / Merge / Delete / no-op汇总整批建议;该 prompt 不允许直接 Add

最终 batch prompt 要求经验不超过 32 个英文词,以一般背景开头,聚焦策略性决策并避免重复;但 Appendix Figure 14 的部分最终经验看起来超过该长度,所以这是一条 prompt 约束,不是实现层的严格保证。复现时应区分正文抽象、单题建议和 batch revision,不能把五种操作当成同一个 controller 同时可用的 API。

6. 多 epoch 让经验进入下一轮行为

上一轮 Et+1 会进入下一 batch/epoch 的 prompt。三轮后冻结经验库用于测试,不需要新 checkpoint。数学实验最终得到 48 条工具使用经验,覆盖有界区域验证、坐标方向、不变量反证、质数检查顺序和解后完整约束检查。

Training-Free GRPO 学到的数学经验片段
Figure 14,论文第 23 页。经验是短的条件化策略,而不是训练题答案或完整 demonstration;其中既有一般校验原则,也有绑定特定数学结构的启发式。
图直接展示经验具备人类可读性,可审计、复制和按域切换。
图暴露的问题经验粒度不统一;规模扩大后需要检索、冲突处理与上下文预算机制。
state: E ← ∅ for epoch = 1...K: for q in training data: O ← rollout πθ(q, E) × G r ← reward(O) if group has winners and losers: S ← summarize each trajectory A_text ← compare_group(S, E, ground_truth) E ← controller(E, all A_text in batch) inference: answer q* with frozen πθ(q*, E)

这不是“无需学习”,而是一种离线经验学习:训练集与测试集分开,多轮优化只改变 E,测试时将 E 作为固定上下文。

Section 04 · Related Work

它比普通反思多了什么

方法线学习单位跨样本状态TF-GRPO 的区别
Self-Refine / Reflexion围绕单个样本反馈与重试通常弱或无在独立训练集上积累共享经验,并显式比较同题多轨迹
In-context RL历史输出 + scalar reward奖励历史进入上下文把历史压缩为可读经验,更省上下文但引入摘要与归因误差
TextGrad结构化计算图中的语言反馈取决于系统固定为 group rollout → relative comparison → experience library
Agent KB知识库 reason-retrieve-refine层次化经验库测试时更简单,直接注入经验;训练过程更像多 epoch on-policy rollout
直接生成提示模型凭先验列建议静态提示TF-GRPO 用奖励差异约束经验来源;消融显示静态建议会降分

与 ACE 的互补关系

ACE 关注长期 playbook 如何增量维护、去重并避免 context collapse;TF-GRPO 关注如何从同题多 rollout 的奖励差异生成经验更新信号。前者更像“如何维护可进化上下文”,后者更像“如何产生相对经验梯度”。这说明两者可以概念组合,但论文没有直接实验一个 TF-GRPO + ACE 系统。

Section 05 · Evaluation Design

实验问题、数据与指标

论文用数学推理和交互式 Web 搜索检验两个层次:经验是否能从 100 个训练样本迁移到不同测试数据集,以及这种迁移是否在无工具/有工具和不同模型上成立。

研究问题训练数据测试策略与工具学习设置指标
数学经验能否迁移到竞赛题DAPO-Math-17K 随机 100 题AIME24 / AIME25Direct;ReAct + Code Interpreter3 epochs;单 batch/epoch;T=0.7;G=5;测试 T=0.332 次独立运行的平均 Pass@1,论文记作 Mean@32
Web 经验能否迁移到新搜索题AFM Web RL 数据随机 100 queriesWebWalkerQAReAct + Web tools全集主实验 3 epochs、G=3;51 题 Table 5 消融为 2 epochspass@1;51 题分层子集另报 pass@3

指标说明Mean@32 是 32 次独立采样的平均 Pass@1,不是“32 次里任意一次成功”的 pass@32。它降低推理随机性,却不是 32 次独立训练复现。

主模型是 DeepSeek-V3.1-Terminus;数学还覆盖 DeepSeek-V3.2-Exp、Qwen3-32B non-thinking 和 Qwen2.5-72B;Web 子集测试 QwQ-32B。这里的 OOD 指 DAPO/AFM 到 AIME/WebWalker 的跨数据集迁移,不表示一个混合经验库自动迁移到任意领域。

Section 06 · Math Results

数学主结果:同模型前后对比稳定为正

80.0 → 82.7DeepSeek-V3.1 + ReAct,AIME24,+2.7
67.9 → 73.3DeepSeek-V3.1 + ReAct,AIME25,+5.4
68.6 → 72.6DeepSeek-V3.1 Direct,AIME24,+4.0
100 samplesDAPO-100,3 个 context-space learning steps
方法模型工具学习成本AIME24AIME25
DirectDeepSeek-V3.1-Terminus--68.652.9
+ TF-GRPO同上-≈ $872.6 (+4.0)54.0 (+1.1)
ReActDeepSeek-V3.1-TerminusCI-80.067.9
+ TF-GRPO同上CI≈ $1882.7 (+2.7)73.3 (+5.4)
ReActDeepSeek-V3.2-ExpCI-71.061.8
+ TF-GRPO同上CI≈ $873.1 (+2.1)63.2 (+1.4)

直接证据在相同 DeepSeek 模型和相同 prompting/ReAct 框架内部,六个主对比全部上升。它足以支持“经验库改善这些基准上的冻结模型行为”。

不能推出Table 3 中“超过 RL-trained 32B 模型”混入了基础模型能力差异;DeepSeek-V3.1 的无经验数学基线已经远高于 Qwen2.5-32B,不能把最终分数差距都归因于 TF-GRPO。

三步学习动态与工具调用

三个 Training-Free GRPO 步骤中的数学成绩与工具调用数
Figure 4,论文第 6 页。训练集 Mean@5 与 AIME24/25 的 Mean@32 随三个 learning steps 上升;AIME 的平均工具调用数下降。
图直接支持多步经验更新与测试表现提升、工具调用减少同时出现。
图没有隔离只有三个点、无误差条,也未控制经验长度;工具调用减少不等于总 token、延迟或真实费用必然下降。

不同规模模型上的数学结果

模型AIME24:ReAct → TF-GRPOAIME25:ReAct → TF-GRPO
Qwen3-32B non-thinking29.1 → 33.5 (+4.4)19.5 → 25.4 (+5.9)
Qwen2.5-72B-Instruct13.5 → 14.9 (+1.4)9.6 → 11.4 (+1.8)
DeepSeek-V3.1-Terminus80.0 → 82.7 (+2.7)67.9 → 73.3 (+5.4)

三种模型都获得数学正增益,说明机制不是单模型偶然。但 Qwen2.5-72B 的基线和增益都很低,参数量本身不是充分条件;instruction following、推理方式和工具能力更可能影响经验执行质量。

Section 07 · Math Ablation

消融定位了三件事:奖励约束、group comparison、经验质量

DeepSeek-V3.1 + ReAct 设置AIME24AIME25解释
无经验基线80.067.9起点
直接生成同数量经验79.867.3两项均下降;静态自我建议不够
TF-GRPO,无 ground truth80.768.9+0.7/+1.0,但明显弱于完整版
TF-GRPO,G=180.469.3单轨迹蒸馏仍有效,但失去组内对比
完整 TF-GRPO,G=582.773.3ground truth 与组比较共同贡献

负结果必须保留直接生成经验使 AIME24 80.0→79.8、AIME25 67.9→67.3。 这排除了“只要多塞一些建议就会变好”的解释,也说明未经对比验证的经验会干扰强模型。

无 ground truth 不是无奖励也能稳定学习

没有正确答案时,比较器依赖多数投票、自判别和反思,仍比基线高 0.7/1.0 点。但完整版相对无 GT 又高 2.0/4.4 点,可靠反馈是主要增益来源之一。“robustness to reward signal”更准确的含义是信号变弱后没有完全失效,而不是奖励质量不重要。

Group-relative 不是命名装饰

把 G 从 5 降到 1 后,AIME25 从 73.3 降至 69.3。单条轨迹仍能总结经验,因此这 4.0 点差距是论文对“赢家-输家比较比单轨迹反思更有效”的直接支持。缺少的是 group size 1/3/5/更多的成本-效果曲线。

Section 08 · Web Searching

Web 主结果为正,但消融揭示明显能力门槛

在 WebWalkerQA 全集上,DeepSeek-V3.1-Terminus + ReAct 的 pass@1 从 63.2 提升到 67.8,绝对提升 4.6 点;然而 51 题子集显示,增益并不在所有模型和指标上成立。

设置差异全集主实验运行 3 epochs;下面 Table 5 的所有 51 题消融模型统一只优化 2 epochs。子集数值用于内部变体比较,不能当作主实验第三轮后的直接复现。

63.2 → 67.8DeepSeek-V3.1,WebWalkerQA 全集 pass@1
66.7 → 64.7直接生成经验,DeepSeek 子集 pass@1 降 2.0
66.7 → 66.7无 ground truth,pass@1 没有提升
27.5 → 25.5QwQ-32B,TF-GRPO 使 pass@1 降 2.0
模型与方法(51 题子集)pass@1pass@3证据含义
QwQ-32B + ReAct27.543.1弱基座起点
QwQ-32B + TF-GRPO25.5 (-2.0)45.1 (+2.0)首试更差,多次尝试略好
DeepSeek-V3.1 + ReAct66.774.5强基座起点
+ 直接生成经验64.7 (-2.0)76.5 (+2.0)pass@1 负迁移
+ TF-GRPO,无 ground truth66.7 (+0.0)78.4 (+3.9)只提高多次尝试覆盖率
+ 完整 TF-GRPO68.6 (+1.9)78.4 (+3.9)完整版最佳,但 pass@1 增幅有限

直接证据强 DeepSeek 基座上,奖励约束的经验提高总体单次成功率;附录案例也显示官方来源优先、迭代改写查询和数值核验等可解释行为变化。

混合与负结果QwQ pass@1 从 27.5 降至 25.5;无 GT 的 DeepSeek pass@1 完全不增。TF-GRPO 更容易改善 pass@3,不保证第一次生成更可靠。基础模型的元认知与工具能力是前提。

主 Web 结果只报告一个总体 pass@1,没有方差、显著性、难度分解和工具调用成本。51 题子集按难度分层,但样本仍小。因而 4.6 点正增益可信为同设置观察,泛化强度仍需更多重复实验。

Section 09 · Cross-Domain Claim

“跨域泛化更强”被不同基础模型混杂

方法(基础模型)学习领域AIME24AIME25WebWalker
ReAct(Qwen2.5-32B-Instruct)29.623.131.9
ReTool(Qwen2.5-32B-Instruct)Math67.049.318.3
MiroThinker(Qwen3-32B)Web43.536.853.6
TF-GRPO(DeepSeek-V3.1-Terminus)Math / Web82.773.367.8

论文主张参数微调造成领域专门化,TF-GRPO 冻结通用模型并按域插拔经验,因此能同时保持数学和 Web 能力。

直接证据Math-specialized ReTool 在 WebWalker 只有 18.3;Web-specialized MiroThinker 在 AIME 上较弱;TF-GRPO 对应系统三个分数最高。

关键混杂Table 6 不是同基座比较。 DeepSeek-V3.1 的无经验数学基线已达 80.0/67.9,而 Qwen2.5 ReAct 只有 29.6/23.1。最终分数不能隔离“上下文空间 vs 参数空间”的因果作用。

TF-GRPO 还为数学与 Web 分别学习、分别注入经验库,并不是单一混合经验库跨域选择策略。更稳妥的结论是:冻结强模型并切换小型领域经验库,是有吸引力的多域部署方式;论文尚未通过同模型、同预算、错域经验注入或经验混合实验,证明它“完全保留泛化能力”。

Section 10 · Cost Model

低成本发生在适应阶段;每次推理反而更贵

学习阶段:$18 对比约 $10,000

作者复现 ReTool 在 Qwen2.5-32B 上的训练,估算 20,000 GPU-hours;按 $0.5/GPU-hour,总成本约 $10,000。TF-GRPO 在 DeepSeek-V3.1 上以 100 样本完成 3 个学习步骤,约 6 小时,消耗 38M input 与 6.6M output tokens,按 DeepSeek 价格约 $18。

这个比较说明 API 大模型的经验适应启动成本远低于重新训练专用 32B 模型。但二者不是同一模型、硬件、能力和最终服务,不能把两个数量级差距解释为纯算法效率。

推理阶段:$0.02/query 高于 $0.005/query

部署方案作者估算的单题成本固定成本适合负载
ReTool-32B,4 GPU + vLLM batching约 $0.005持续占用专用 GPU高且稳定的请求量
DeepSeek API + TF-GRPO约 $0.02无专用集群,按量付费低频、波动、不可预测的请求量

成本边界TF-GRPO 单题变量成本约为专用小模型的 4 倍。 优势来自避免闲置 GPU,而不是每次推理更便宜。平均每题还使用约 60K input 与 8K output tokens,并假设大部分重复上下文命中低价 cache。

论文没有给出经验库自身 token 占比、实测 cache hit、不同请求量的 break-even point、网络延迟或 API 价格敏感性。因此成本主张只在低流量、服务可用且缓存有效时成立。

Section 11 · Appendix Cases

经验不是答案记忆,而是改变过程中的决策门

几何题:从局部算式修正到完整约束验证

无经验 Agent 把矩形 EFGH 的垂直方向设错,反复更换点顺序与参数化,最后接受约 106.91 的伪解。经验引导后,它先固定 D-E-C-F 顺序,令 CE=x 且 0<x<107,统一推出 DE=107-x、CF=184-x,选择正确垂直方向,再用区间过滤额外根,最终得到 CE=104 并验证矩形尺寸、共线和共圆。

这里几条经验分别承担方向解释、统一参数、根过滤和解后验证,不包含目标题答案。它说明经验可以重塑 Agent 的过程结构。

Web 搜索:从摘要依赖到官方来源核验

无经验 Agent 已在搜索摘要看到“100 ILV per week”,却没有打开官方文章,只确认了另一半 200,000 ILV / six months。加入 primary-source prioritization、formal-title identification、iterative refinement 和 partial-match evaluation 后,Agent 打开 Illuvium 官方公告并同时核验两个数值。

案例与总体 Web 增益在机制上相符,但属于作者选择的成功案例;论文没有展示经验导致搜索变差的轨迹,不能用案例替代分布级评测。

Section 12 · Claim Audit

论文证明了什么,暗示了什么,没有证明什么

实验较好支持

DeepSeek 上 100 样本经验改善 AIME 与 WebWalker;组内比较优于直接经验和 G=1;可靠 ground truth 明显增强结果;外部经验可读、可插拔。

合理但证据有限

三步上升暗示 context-space policy iteration;冻结模型可能减少参数过拟合;领域经验库可能降低多专家维护成本。

尚未证明

语义 advantage 与 GRPO 目标等价;方法普遍优于 RL;冻结权重就完全保留泛化;适用于弱模型与任意工具环境。

需要附加条件

$18 vs $10,000 依赖不同模型和部署;$0.02/query 只在低流量时可能优于维持 GPU;缓存假设影响真实价格。

最强证据同模型、同框架前后的数学与 Web 主结果,以及直接经验、无 ground truth、G=1 三组消融。

最稳妥结论Group-relative comparison 能生成比静态自我建议更有效的外部经验;这些经验在强基础模型和可靠反馈下,能低启动成本地改善部分未见任务。

Section 13 · Limitations

论文没有单列 Limitations,但结果已经暴露五类边界

以下边界来自方法细节、消融与成本数据,不是作者显式给出的完整 limitations 清单。

1. 基础模型同时扮演学习器与执行器

同一类 LLM 负责 rollout、摘要、组比较、经验控制和最终执行。它既诊断自己又执行自己的规则,容易自我确认。QwQ-32B 的 Web pass@1 负迁移说明元认知和工具能力是方法前提。

2. 经验库没有显式优化目标与回滚门

增删改合并由语言判断完成,没有全局目标、单调改进保证或错误经验的自动回滚。短句限制减少膨胀,却可能删去适用条件;不同训练问题的建议也可能冲突。

3. 奖励质量决定经验方向

无 GT 增益明显缩小,Web pass@1 完全不增。只要 reward、judge 或多数投票误判,semantic advantage 就可能把错误解释固化。全组同分直接跳过,也会遗漏共同失败。

4. 评测范围与统计报告不足

只有数学和 Web 两域,训练集各 100 条,Web 消融仅 51 条。论文没有多个训练数据种子、置信区间或显著性检验;AIME 的 32 次采样平均不是独立训练重复。

5. 长期可扩展性未验证

数学只展示 48 条经验,没有研究数百或数千条时的检索、顺序效应、冲突、遗忘与上下文上限。直接全部注入在小库上可行,规模增大后可能需要 ACE 式增量维护或显式 retrieval。

复现优先级最有说服力的后续对照应在同一开放模型、同一总预算下比较 LoRA/SFT、GRPO、静态经验、单轨迹反思和 TF-GRPO,并统一核算训练、上下文、推理和部署成本。

Section 14 · Self-Evolution

对 AI 自进化研究的意义

TF-GRPO 把自进化拆成一个可观察闭环:行动产生多条轨迹,奖励制造差异,模型把差异解释成经验,经验再改变下一轮行动。

它的价值不在于重新发明 GRPO,而在于说明 group-relative 信号可以脱离梯度,成为外部认知状态的更新规则。经验位于模型外,因而可审计、可编辑、可按域切换,也能直接服务不可微调的 API 模型。

更适合 TF-GRPO 的条件更可能需要其他方案的条件
基础模型已具备强推理和工具能力基础模型连比较轨迹和执行经验都不稳定
任务能提供可靠、可比较 reward反馈稀疏、噪声大或容易被模型自判误导
经验可压缩为短自然语言策略知识必须精确结构化或依赖大量事实检索
低频、多领域、希望按域插拔高吞吐固定负载,长上下文变量成本过高
需要经验可读、可回滚、无需 checkpoint需要严格优化保证、稳定收敛或参数内低延迟

后续最值得补的是机制而非单纯堆 benchmark:长期经验如何去重与处理冲突;semantic advantage 如何配接受/回滚门;actor、critic、curator 是否应分离;context-space 与 parameter-space 如何在同基座同预算下公平比较。

Section 15 · Final Verdict

最终判断:实用的经验优化原型,不是 RL 的普遍替代

论文主张TF-GRPO 将 policy optimization 从参数空间迁移到上下文空间,以少量样本和低学习成本改善冻结大模型 Agent,并保留跨域能力。

直接证据DeepSeek-V3.1 + ReAct 在 AIME24/25 从 80.0/67.9 提升到 82.7/73.3,WebWalkerQA 从 63.2 提升到 67.8;直接经验和 G=1 消融明显更弱;学习阶段约 100 样本、3 steps、$18。

本文解读论文最扎实的创新是 group-relative trajectory comparison → textual experience update。把它称作“受 GRPO 启发的外部经验优化”比“无训练的 GRPO 等价物”更准确。

限制方法依赖强模型与可靠奖励;QwQ Web pass@1 27.5→25.5、无 GT Web pass@1 不增、直接经验两域负迁移。跨域表和成本表还混入不同模型、能力与部署方式。

TF-GRPO 证明了上下文经验可以成为有效、低门槛、可解释的适应状态,也给出了从奖励差异生成经验的具体闭环;它尚未证明 semantic advantage 具有 GRPO 的优化性质,也未证明 context-space optimization 可以普遍替代 parameter-space RL。