被保留的 GRPO 结构
同题 group rollout、scalar reward、组内相对比较、多轮更新。
不改权重,用同题多轨迹的成功/失败差异学习一套可插拔经验,能否获得类似 policy optimization 的行为变化?
对同一个问题采样多条 rollout,用奖励区分成功与失败轨迹,再让 LLM 比较这些轨迹并抽取“哪些动作导致高奖励”的自然语言经验;经验不进入反向传播,而是增删改外部经验库 E,下一轮推理把它作为 token prior 注入。
同题 group rollout、scalar reward、组内相对比较、多轮更新。
数值 advantage → 语义经验;参数 θ → 外部经验库 E;梯度 → 文本操作。
没有参数训练,但仍需要训练集、ground truth 或 reward、采样、3 epochs 和 API 成本。
semantic advantage 提供更新方向,却没有 GRPO 目标函数、KL 约束或收敛保证。
本文解读这篇论文最值得学习的不是命名,而是 group-relative trajectory comparison → textual experience update:把普通单轨迹反思变成有对照、有奖励约束、可跨样本累积的经验学习。
大型语言模型已经具备推理、搜索、编程和计算机操作能力,但专业任务通常还要求理解特定任务定义、选择正确工具、遵循领域工作流,并在长链条中控制 API 调用。通用模型缺少这些规则和工具经验时,常出现错误调用、低效搜索与策略缺失。
Agentic RL 通过 SFT 和 RL 把这些行为写入参数;GRPO 又能通过同题多回答估计相对优势而省去 critic。论文没有否认这种路线有效,而是指出它在大量真实业务中受到四种约束。
大模型微调成本高,专用 checkpoint 还需要独立服务。低频任务为闲置 GPU 持续付费并不经济。
参数优化可能缩窄模型行为;多个领域分别训练、部署和维护多个专家,系统复杂度随之增长。
专业标注昂贵,少样本恰恰更易过拟合,形成“最需要适应的任务最缺训练数据”的矛盾。
预算迫使团队训练 32B 以下模型;更强的 API 大模型持续更新、成本性能更好,却通常无法微调。
由此出现论文的研究问题:如果强模型已具备基本推理和工具能力,能否只从少量练习中学习可复用策略,把它们作为 token prior 注入,而不重写参数?形式上,参数更新改变 πθ(y|q);上下文更新保持 θ 不变,把条件改成 πθ(y|q,E)。
论文主张冻结权重可以避免少样本微调的过拟合与专门化损伤,并让不同领域只需切换经验库。
限定冻结参数只能保证 checkpoint 没被永久改写,不能保证注入的经验永远不造成负迁移。论文自己的直接经验与 QwQ Web 结果已经表明,context-space 更新同样可能让行为变差。
因此,方法要证明的不只是“prompt 有用”,而是同题相对比较能否产生比静态提示更可靠的经验,并在跨 epoch、跨未见题目时持续改善。
对查询 q,策略 πθ 采样 G 个输出,奖励模型产生 ri,再以组内均值和标准差计算相对优势。优势进入 PPO-clipped objective,并配合 reference model 的 KL 惩罚更新 θ。
模型参数永久冻结,经验库 E 初始为空。同题仍成组采样并评分,但每条轨迹先被压缩成摘要,LLM 再比较赢家和输家,解释成功/失败原因并输出自然语言建议 Atext。一个 batch 的建议由 controller 汇总成对 E 的操作。
| 维度 | Vanilla GRPO | Training-Free GRPO | 判断 |
|---|---|---|---|
| 探索单元 | 同题 G 个输出 | 同题 G 条回答/Agent 轨迹 | 结构相似 |
| 质量信号 | scalar reward | 仍先使用 scalar reward | 基本相同 |
| 相对信号 | 标准化数值 Âᵢ | LLM 解释的 Atext | 表达与统计性质不同 |
| 优化对象 | 参数 θ | 经验库 E | 完全不同 |
| 更新机制 | 目标函数梯度 | Add / Modify / Delete / Merge / Keep | 完全不同 |
| 稳定机制 | reference policy + KL | 冻结基础模型作为 strong prior | 只是作者的功能类比 |
| 部署形态 | 新 checkpoint | 可切换的外部文本 | 后者更可插拔、可审计 |
数学任务 prompt 要求模型先阅读 helpful instructions and experiences,再求解问题;ReAct 设置允许选择性调用 Python code interpreter。数学使用 DAPO-100、3 epochs、每个 epoch 一个 batch、训练温度 0.7、G=5;Web 使用 AFM-100、3 epochs、G=3。
若同组所有轨迹奖励相同,vanilla GRPO 的标准差为零,论文也不生成 semantic advantage。这能减少没有对比依据的更新,却会遗漏“全组都错”的共同失败模式,也不能从“全组都对”中继续学习更短或更低成本的策略。
附录 prompt 要求逐步记录动作、使用了哪条经验、哪里发生 detour、error 或 backtracking,并保留错误步骤的核心产出。摘要让长 Agent 轨迹可以成组比较,也决定比较器最终看见哪些因果线索。
遗漏实验论文没有单独消融摘要器,也未比较摘要模型与长度。错误压缩或错误归因会直接污染后续 semantic advantage。
比较器同时分析成功决策、错误位置、被遗漏或不足的旧经验,并为新经验说明适用场景和可迁移问题模式。与单条失败轨迹的泛泛反思相比,同题轨迹共享问题条件,行为差异更接近奖励差异的原因。
| 来源 | 允许操作 | 作用 |
|---|---|---|
| 正文算法抽象 | Add / Delete / Modify / Keep | 概念层描述经验库可发生的变化 |
| Figure 12:单题 group advantage | Add / Modify / Delete / no-op | 从同题赢家与输家形成局部更新建议 |
| Figure 13:batch optimization | Modify / Merge / Delete / no-op | 汇总整批建议;该 prompt 不允许直接 Add |
最终 batch prompt 要求经验不超过 32 个英文词,以一般背景开头,聚焦策略性决策并避免重复;但 Appendix Figure 14 的部分最终经验看起来超过该长度,所以这是一条 prompt 约束,不是实现层的严格保证。复现时应区分正文抽象、单题建议和 batch revision,不能把五种操作当成同一个 controller 同时可用的 API。
上一轮 Et+1 会进入下一 batch/epoch 的 prompt。三轮后冻结经验库用于测试,不需要新 checkpoint。数学实验最终得到 48 条工具使用经验,覆盖有界区域验证、坐标方向、不变量反证、质数检查顺序和解后完整约束检查。
这不是“无需学习”,而是一种离线经验学习:训练集与测试集分开,多轮优化只改变 E,测试时将 E 作为固定上下文。
| 方法线 | 学习单位 | 跨样本状态 | TF-GRPO 的区别 |
|---|---|---|---|
| Self-Refine / Reflexion | 围绕单个样本反馈与重试 | 通常弱或无 | 在独立训练集上积累共享经验,并显式比较同题多轨迹 |
| In-context RL | 历史输出 + scalar reward | 奖励历史进入上下文 | 把历史压缩为可读经验,更省上下文但引入摘要与归因误差 |
| TextGrad | 结构化计算图中的语言反馈 | 取决于系统 | 固定为 group rollout → relative comparison → experience library |
| Agent KB | 知识库 reason-retrieve-refine | 层次化经验库 | 测试时更简单,直接注入经验;训练过程更像多 epoch on-policy rollout |
| 直接生成提示 | 模型凭先验列建议 | 静态提示 | TF-GRPO 用奖励差异约束经验来源;消融显示静态建议会降分 |
ACE 关注长期 playbook 如何增量维护、去重并避免 context collapse;TF-GRPO 关注如何从同题多 rollout 的奖励差异生成经验更新信号。前者更像“如何维护可进化上下文”,后者更像“如何产生相对经验梯度”。这说明两者可以概念组合,但论文没有直接实验一个 TF-GRPO + ACE 系统。
论文用数学推理和交互式 Web 搜索检验两个层次:经验是否能从 100 个训练样本迁移到不同测试数据集,以及这种迁移是否在无工具/有工具和不同模型上成立。
| 研究问题 | 训练数据 | 测试 | 策略与工具 | 学习设置 | 指标 |
|---|---|---|---|---|---|
| 数学经验能否迁移到竞赛题 | DAPO-Math-17K 随机 100 题 | AIME24 / AIME25 | Direct;ReAct + Code Interpreter | 3 epochs;单 batch/epoch;T=0.7;G=5;测试 T=0.3 | 32 次独立运行的平均 Pass@1,论文记作 Mean@32 |
| Web 经验能否迁移到新搜索题 | AFM Web RL 数据随机 100 queries | WebWalkerQA | ReAct + Web tools | 全集主实验 3 epochs、G=3;51 题 Table 5 消融为 2 epochs | pass@1;51 题分层子集另报 pass@3 |
指标说明Mean@32 是 32 次独立采样的平均 Pass@1,不是“32 次里任意一次成功”的 pass@32。它降低推理随机性,却不是 32 次独立训练复现。
主模型是 DeepSeek-V3.1-Terminus;数学还覆盖 DeepSeek-V3.2-Exp、Qwen3-32B non-thinking 和 Qwen2.5-72B;Web 子集测试 QwQ-32B。这里的 OOD 指 DAPO/AFM 到 AIME/WebWalker 的跨数据集迁移,不表示一个混合经验库自动迁移到任意领域。
| 方法 | 模型 | 工具 | 学习成本 | AIME24 | AIME25 |
|---|---|---|---|---|---|
| Direct | DeepSeek-V3.1-Terminus | - | - | 68.6 | 52.9 |
| + TF-GRPO | 同上 | - | ≈ $8 | 72.6 (+4.0) | 54.0 (+1.1) |
| ReAct | DeepSeek-V3.1-Terminus | CI | - | 80.0 | 67.9 |
| + TF-GRPO | 同上 | CI | ≈ $18 | 82.7 (+2.7) | 73.3 (+5.4) |
| ReAct | DeepSeek-V3.2-Exp | CI | - | 71.0 | 61.8 |
| + TF-GRPO | 同上 | CI | ≈ $8 | 73.1 (+2.1) | 63.2 (+1.4) |
直接证据在相同 DeepSeek 模型和相同 prompting/ReAct 框架内部,六个主对比全部上升。它足以支持“经验库改善这些基准上的冻结模型行为”。
不能推出Table 3 中“超过 RL-trained 32B 模型”混入了基础模型能力差异;DeepSeek-V3.1 的无经验数学基线已经远高于 Qwen2.5-32B,不能把最终分数差距都归因于 TF-GRPO。
| 模型 | AIME24:ReAct → TF-GRPO | AIME25:ReAct → TF-GRPO |
|---|---|---|
| Qwen3-32B non-thinking | 29.1 → 33.5 (+4.4) | 19.5 → 25.4 (+5.9) |
| Qwen2.5-72B-Instruct | 13.5 → 14.9 (+1.4) | 9.6 → 11.4 (+1.8) |
| DeepSeek-V3.1-Terminus | 80.0 → 82.7 (+2.7) | 67.9 → 73.3 (+5.4) |
三种模型都获得数学正增益,说明机制不是单模型偶然。但 Qwen2.5-72B 的基线和增益都很低,参数量本身不是充分条件;instruction following、推理方式和工具能力更可能影响经验执行质量。
| DeepSeek-V3.1 + ReAct 设置 | AIME24 | AIME25 | 解释 |
|---|---|---|---|
| 无经验基线 | 80.0 | 67.9 | 起点 |
| 直接生成同数量经验 | 79.8 | 67.3 | 两项均下降;静态自我建议不够 |
| TF-GRPO,无 ground truth | 80.7 | 68.9 | +0.7/+1.0,但明显弱于完整版 |
| TF-GRPO,G=1 | 80.4 | 69.3 | 单轨迹蒸馏仍有效,但失去组内对比 |
| 完整 TF-GRPO,G=5 | 82.7 | 73.3 | ground truth 与组比较共同贡献 |
负结果必须保留直接生成经验使 AIME24 80.0→79.8、AIME25 67.9→67.3。 这排除了“只要多塞一些建议就会变好”的解释,也说明未经对比验证的经验会干扰强模型。
没有正确答案时,比较器依赖多数投票、自判别和反思,仍比基线高 0.7/1.0 点。但完整版相对无 GT 又高 2.0/4.4 点,可靠反馈是主要增益来源之一。“robustness to reward signal”更准确的含义是信号变弱后没有完全失效,而不是奖励质量不重要。
把 G 从 5 降到 1 后,AIME25 从 73.3 降至 69.3。单条轨迹仍能总结经验,因此这 4.0 点差距是论文对“赢家-输家比较比单轨迹反思更有效”的直接支持。缺少的是 group size 1/3/5/更多的成本-效果曲线。
在 WebWalkerQA 全集上,DeepSeek-V3.1-Terminus + ReAct 的 pass@1 从 63.2 提升到 67.8,绝对提升 4.6 点;然而 51 题子集显示,增益并不在所有模型和指标上成立。
设置差异全集主实验运行 3 epochs;下面 Table 5 的所有 51 题消融模型统一只优化 2 epochs。子集数值用于内部变体比较,不能当作主实验第三轮后的直接复现。
| 模型与方法(51 题子集) | pass@1 | pass@3 | 证据含义 |
|---|---|---|---|
| QwQ-32B + ReAct | 27.5 | 43.1 | 弱基座起点 |
| QwQ-32B + TF-GRPO | 25.5 (-2.0) | 45.1 (+2.0) | 首试更差,多次尝试略好 |
| DeepSeek-V3.1 + ReAct | 66.7 | 74.5 | 强基座起点 |
| + 直接生成经验 | 64.7 (-2.0) | 76.5 (+2.0) | pass@1 负迁移 |
| + TF-GRPO,无 ground truth | 66.7 (+0.0) | 78.4 (+3.9) | 只提高多次尝试覆盖率 |
| + 完整 TF-GRPO | 68.6 (+1.9) | 78.4 (+3.9) | 完整版最佳,但 pass@1 增幅有限 |
直接证据强 DeepSeek 基座上,奖励约束的经验提高总体单次成功率;附录案例也显示官方来源优先、迭代改写查询和数值核验等可解释行为变化。
混合与负结果QwQ pass@1 从 27.5 降至 25.5;无 GT 的 DeepSeek pass@1 完全不增。TF-GRPO 更容易改善 pass@3,不保证第一次生成更可靠。基础模型的元认知与工具能力是前提。
主 Web 结果只报告一个总体 pass@1,没有方差、显著性、难度分解和工具调用成本。51 题子集按难度分层,但样本仍小。因而 4.6 点正增益可信为同设置观察,泛化强度仍需更多重复实验。
| 方法(基础模型) | 学习领域 | AIME24 | AIME25 | WebWalker |
|---|---|---|---|---|
| ReAct(Qwen2.5-32B-Instruct) | 无 | 29.6 | 23.1 | 31.9 |
| ReTool(Qwen2.5-32B-Instruct) | Math | 67.0 | 49.3 | 18.3 |
| MiroThinker(Qwen3-32B) | Web | 43.5 | 36.8 | 53.6 |
| TF-GRPO(DeepSeek-V3.1-Terminus) | Math / Web | 82.7 | 73.3 | 67.8 |
论文主张参数微调造成领域专门化,TF-GRPO 冻结通用模型并按域插拔经验,因此能同时保持数学和 Web 能力。
直接证据Math-specialized ReTool 在 WebWalker 只有 18.3;Web-specialized MiroThinker 在 AIME 上较弱;TF-GRPO 对应系统三个分数最高。
关键混杂Table 6 不是同基座比较。 DeepSeek-V3.1 的无经验数学基线已达 80.0/67.9,而 Qwen2.5 ReAct 只有 29.6/23.1。最终分数不能隔离“上下文空间 vs 参数空间”的因果作用。
TF-GRPO 还为数学与 Web 分别学习、分别注入经验库,并不是单一混合经验库跨域选择策略。更稳妥的结论是:冻结强模型并切换小型领域经验库,是有吸引力的多域部署方式;论文尚未通过同模型、同预算、错域经验注入或经验混合实验,证明它“完全保留泛化能力”。
作者复现 ReTool 在 Qwen2.5-32B 上的训练,估算 20,000 GPU-hours;按 $0.5/GPU-hour,总成本约 $10,000。TF-GRPO 在 DeepSeek-V3.1 上以 100 样本完成 3 个学习步骤,约 6 小时,消耗 38M input 与 6.6M output tokens,按 DeepSeek 价格约 $18。
这个比较说明 API 大模型的经验适应启动成本远低于重新训练专用 32B 模型。但二者不是同一模型、硬件、能力和最终服务,不能把两个数量级差距解释为纯算法效率。
| 部署方案 | 作者估算的单题成本 | 固定成本 | 适合负载 |
|---|---|---|---|
| ReTool-32B,4 GPU + vLLM batching | 约 $0.005 | 持续占用专用 GPU | 高且稳定的请求量 |
| DeepSeek API + TF-GRPO | 约 $0.02 | 无专用集群,按量付费 | 低频、波动、不可预测的请求量 |
成本边界TF-GRPO 单题变量成本约为专用小模型的 4 倍。 优势来自避免闲置 GPU,而不是每次推理更便宜。平均每题还使用约 60K input 与 8K output tokens,并假设大部分重复上下文命中低价 cache。
论文没有给出经验库自身 token 占比、实测 cache hit、不同请求量的 break-even point、网络延迟或 API 价格敏感性。因此成本主张只在低流量、服务可用且缓存有效时成立。
无经验 Agent 把矩形 EFGH 的垂直方向设错,反复更换点顺序与参数化,最后接受约 106.91 的伪解。经验引导后,它先固定 D-E-C-F 顺序,令 CE=x 且 0<x<107,统一推出 DE=107-x、CF=184-x,选择正确垂直方向,再用区间过滤额外根,最终得到 CE=104 并验证矩形尺寸、共线和共圆。
这里几条经验分别承担方向解释、统一参数、根过滤和解后验证,不包含目标题答案。它说明经验可以重塑 Agent 的过程结构。
无经验 Agent 已在搜索摘要看到“100 ILV per week”,却没有打开官方文章,只确认了另一半 200,000 ILV / six months。加入 primary-source prioritization、formal-title identification、iterative refinement 和 partial-match evaluation 后,Agent 打开 Illuvium 官方公告并同时核验两个数值。
案例与总体 Web 增益在机制上相符,但属于作者选择的成功案例;论文没有展示经验导致搜索变差的轨迹,不能用案例替代分布级评测。
DeepSeek 上 100 样本经验改善 AIME 与 WebWalker;组内比较优于直接经验和 G=1;可靠 ground truth 明显增强结果;外部经验可读、可插拔。
三步上升暗示 context-space policy iteration;冻结模型可能减少参数过拟合;领域经验库可能降低多专家维护成本。
语义 advantage 与 GRPO 目标等价;方法普遍优于 RL;冻结权重就完全保留泛化;适用于弱模型与任意工具环境。
$18 vs $10,000 依赖不同模型和部署;$0.02/query 只在低流量时可能优于维持 GPU;缓存假设影响真实价格。
最强证据同模型、同框架前后的数学与 Web 主结果,以及直接经验、无 ground truth、G=1 三组消融。
最稳妥结论Group-relative comparison 能生成比静态自我建议更有效的外部经验;这些经验在强基础模型和可靠反馈下,能低启动成本地改善部分未见任务。
以下边界来自方法细节、消融与成本数据,不是作者显式给出的完整 limitations 清单。
同一类 LLM 负责 rollout、摘要、组比较、经验控制和最终执行。它既诊断自己又执行自己的规则,容易自我确认。QwQ-32B 的 Web pass@1 负迁移说明元认知和工具能力是方法前提。
增删改合并由语言判断完成,没有全局目标、单调改进保证或错误经验的自动回滚。短句限制减少膨胀,却可能删去适用条件;不同训练问题的建议也可能冲突。
无 GT 增益明显缩小,Web pass@1 完全不增。只要 reward、judge 或多数投票误判,semantic advantage 就可能把错误解释固化。全组同分直接跳过,也会遗漏共同失败。
只有数学和 Web 两域,训练集各 100 条,Web 消融仅 51 条。论文没有多个训练数据种子、置信区间或显著性检验;AIME 的 32 次采样平均不是独立训练重复。
数学只展示 48 条经验,没有研究数百或数千条时的检索、顺序效应、冲突、遗忘与上下文上限。直接全部注入在小库上可行,规模增大后可能需要 ACE 式增量维护或显式 retrieval。
复现优先级最有说服力的后续对照应在同一开放模型、同一总预算下比较 LoRA/SFT、GRPO、静态经验、单轨迹反思和 TF-GRPO,并统一核算训练、上下文、推理和部署成本。
TF-GRPO 把自进化拆成一个可观察闭环:行动产生多条轨迹,奖励制造差异,模型把差异解释成经验,经验再改变下一轮行动。
它的价值不在于重新发明 GRPO,而在于说明 group-relative 信号可以脱离梯度,成为外部认知状态的更新规则。经验位于模型外,因而可审计、可编辑、可按域切换,也能直接服务不可微调的 API 模型。
| 更适合 TF-GRPO 的条件 | 更可能需要其他方案的条件 |
|---|---|
| 基础模型已具备强推理和工具能力 | 基础模型连比较轨迹和执行经验都不稳定 |
| 任务能提供可靠、可比较 reward | 反馈稀疏、噪声大或容易被模型自判误导 |
| 经验可压缩为短自然语言策略 | 知识必须精确结构化或依赖大量事实检索 |
| 低频、多领域、希望按域插拔 | 高吞吐固定负载,长上下文变量成本过高 |
| 需要经验可读、可回滚、无需 checkpoint | 需要严格优化保证、稳定收敛或参数内低延迟 |
后续最值得补的是机制而非单纯堆 benchmark:长期经验如何去重与处理冲突;semantic advantage 如何配接受/回滚门;actor、critic、curator 是否应分离;context-space 与 parameter-space 如何在同基座同预算下公平比较。
论文主张TF-GRPO 将 policy optimization 从参数空间迁移到上下文空间,以少量样本和低学习成本改善冻结大模型 Agent,并保留跨域能力。
直接证据DeepSeek-V3.1 + ReAct 在 AIME24/25 从 80.0/67.9 提升到 82.7/73.3,WebWalkerQA 从 63.2 提升到 67.8;直接经验和 G=1 消融明显更弱;学习阶段约 100 样本、3 steps、$18。
本文解读论文最扎实的创新是 group-relative trajectory comparison → textual experience update。把它称作“受 GRPO 启发的外部经验优化”比“无训练的 GRPO 等价物”更准确。
限制方法依赖强模型与可靠奖励;QwQ Web pass@1 27.5→25.5、无 GT Web pass@1 不增、直接经验两域负迁移。跨域表和成本表还混入不同模型、能力与部署方式。