Recursive Multi-Agent Systems 论文汇报
把递归语言模型的 latent computation 思想扩展到多智能体系统,通过 RecursiveLink 让异构 agent 在隐藏状态空间中递归协作。
1. 论文基本信息
- 论文标题:Recursive Multi-Agent Systems
- 作者:Xiyuan Yang, Jiaru Zou, Rui Pan, Ruizhong Qiu, Pan Lu, Shizhe Diao, Jindong Jiang, Hanghang Tong, Tong Zhang, Markus J. Buehler, Jingrui He, James Zou
- 机构:UIUC, Stanford University, NVIDIA, MIT
- 版本:arXiv:2604.25917v1
- 时间:2026 年 4 月 28 日
- 项目主页:https://recursivemas.github.io
- 本文提出
RecursiveMAS,把“递归语言模型”中反复复用同一计算、逐步加深推理的思想扩展到多智能体系统。它不再让多个 agent 通过文本轮流交流,而是让 agent 在 latent space 中传递隐藏状态,并通过轻量的RecursiveLink模块把整个多智能体系统组织成一个可训练的递归循环。论文声称,相比文本式多智能体递归,RecursiveMAS 同时提升准确率、降低 token 使用量,并加快端到端推理。
2. 提纲 / 背景
2.1 背景:多智能体系统的扩展问题
大语言模型在复杂任务上常见瓶颈包括模型容量有限、单次生成短视、探索解空间效率不足。多智能体系统(MAS)试图把多个具有不同角色或专长的模型组织起来,例如 Planner、Critic、Solver 的顺序管线,或者数学、代码、科学专家的混合协作。
这类系统的核心假设是:单个模型不一定足以解决复杂任务,但多个模型通过分工、反馈和集成可以形成更强的系统能力。
现有 MAS 主要有两类改进路线:
- 文本层面的 prompt / context 迭代:通过自然语言反馈、更新 prompt、改进共享上下文来协调 agent。
- 模型层面的训练:分别微调某些 agent,或者训练角色特定输出。
这两类方法都有局限。文本交互会产生大量中间 token,递归轮数增加后延迟和 token 成本迅速上升;分别训练每个 agent 又难以把整个系统作为统一目标进行优化。
2.2 背景:递归语言模型提供了另一条 scaling 轴
递归语言模型(Recursive Language Models, RLMs)的思路是:不只是增加参数量或 token 长度,而是让同一组计算层在 latent state 上反复作用,从而增加推理深度。直观上,模型可以在连续表征空间中多轮 refinement,而不必每一步都解码成文本。
本文把这个思想迁移到 MAS:如果单个模型可以通过递归 latent computation 加深推理,那么多智能体协作本身是否也能通过递归来 scale?
2.3 本文定位
本文的定位不是提出一个新的单模型推理结构,而是提出一个系统级 agentic recursion 框架。RecursiveMAS 试图回答:
- 如何让多个异构 agent 在 latent space 中递归协作?
- 如何只训练轻量连接模块,而不是更新所有 LLM 参数?
- latent-space 协作相比 text-mediated 协作是否更快、更省 token、更容易训练?
- 这种机制是否能泛化到不同 MAS 协作模式?
3. 研究问题与目标
3.1 研究问题
本文的核心研究问题是:
能否把多智能体系统看作一个统一的递归计算图,并通过 latent-state transfer 实现更高效、更可训练的 agent collaboration scaling?
更具体地说,论文要解决的是传统 MAS 中的三个问题。
第一,文本通信成本高。标准 MAS 常让每个 agent 输出完整文本,再把文本传给下一个 agent。递归轮数越多,中间文本越多,解码和上下文处理成本越高。
第二,系统级训练困难。如果每个 agent 都是完整 LLM,直接训练所有参数成本高;如果只训练单个 agent,又不能真正优化跨 agent 的协作链路。
第三,文本交互不利于端到端梯度传播。文本 token 采样或离散化会让递归链路中的梯度信号变弱,难以对整个系统做统一 credit assignment。
3.2 工作目标
RecursiveMAS 的目标可以概括为四点:
- 用 latent thoughts 替代中间文本,让 agent 在隐藏状态层面传递信息。
- 用轻量
RecursiveLink连接 agent 内部和 agent 之间的表示空间。 - 冻结所有基础 LLM,只训练 inner / outer RecursiveLink,降低训练成本。
- 通过 inner-outer loop learning 对整个 MAS 递归链路做统一优化。
本文最终希望证明:递归不只是单模型的 scaling 方式,也可以成为多智能体协作的系统级 scaling 方式。
4. 核心方法 / 模型
4.1 方法总览
RecursiveMAS 把一个多智能体系统组织成一个 latent-space recursion loop。每个 agent 不再在每轮都输出完整中间文本,而是在自己的 Transformer hidden states 中生成一段连续的 latent thoughts,再通过 RecursiveLink 传给下一个 agent。最后一个 agent 的 latent output 会在中间轮次回传给第一个 agent,形成递归循环;只有最终递归轮的最后一个 agent 才解码出文本答案。

4.2 RecursiveLink:轻量连接模块
RecursiveLink 是本文最关键的结构组件。它负责把一个表示空间中的 hidden state 转换到另一个表示空间,使 latent thoughts 可以继续被模型消费。
论文定义了两类 RecursiveLink。
第一类是 inner RecursiveLink。它在单个 agent 内部使用,把模型刚生成的 last-layer hidden state 映射回该 agent 的 input embedding space,从而支持下一步 latent generation。公式为:
R_in(h) = h + W2 * GELU(W1 * h)
这里的 residual connection 保留原始 latent semantics,MLP 分支学习从 last-layer hidden state 到 input embedding distribution 的偏移。
第二类是 outer RecursiveLink。它在不同 agent 之间使用,解决异构模型 hidden dimension 或 embedding distribution 不一致的问题。公式为:
R_out(h) = W3 * h + W2 * GELU(W1 * h)
其中 W3 把源 agent 的 hidden state 映射到目标 agent 的 embedding space。相比 inner link,outer link 多了一个 residual branch 上的线性投影。

4.3 Agent 内部的 latent thoughts generation
给定问题和 agent-specific instruction 的输入 embedding,agent 首先正常前向得到最后一层 hidden state h_t。不同于标准自回归解码,RecursiveMAS 不把 h_t 投影到词表并采样 token,而是用 inner RecursiveLink 得到下一步输入 embedding:
e_{t+1} = R_in(h_t)
这个过程重复 m 步,得到一段连续 latent thoughts:
H_A = [h_t, h_{t+1}, ..., h_{t+m}]
这段 latent thoughts 相当于 agent 的内部思考轨迹,但它不经过文本解码,因此避免了中间 token 生成成本。
4.4 Agent 之间的 latent interaction
当 agent A1 完成 latent thoughts generation 后,它的 latent thoughts 会经过 outer RecursiveLink 转换到 agent A2 的 embedding space。A2 的输入由两部分组成:
E_A2 ⊕ R_out(H_A1)
也就是自身原始上下文 embedding 加上来自前一个 agent 的 latent information。这个过程沿着所有 agent 依次进行。最后一个 agent 完成 latent generation 后,其 latent output 会被传回第一个 agent,进入下一轮 recursion。
这种设计使得不同 agent 可以在连续表示空间中交换信息,而不是通过“Planner 写一段话,Critic 再读这段话,Solver 再读 Critic 的话”的显式文本方式协作。
4.5 支持的四种多智能体协作模式
RecursiveMAS 不绑定单一 MAS 拓扑。论文实例化了四种协作模式。
| 协作模式 | agent 角色 | 机制含义 |
|---|---|---|
| Sequential Style | Planner, Critic, Solver | 顺序分解、批评、修正、求解 |
| Mixture Style | Math / Code / Science Specialist, Summarizer | 多领域专家并行推理,再由汇总者聚合 |
| Distillation Style | Expert, Learner | 大模型专家向小模型学习者传递能力 |
| Deliberation Style | Reflector, Tool-Caller | 反思 agent 与工具调用 agent 递归协作 |
这一设计的意义是:RecursiveMAS 不是一个只适用于 Planner-Critic-Solver 的 pipeline trick,而是试图成为一种结构无关的 latent collaboration interface。
4.6 训练流程:inner-outer loop learning
RecursiveMAS 的训练分两阶段。

第一阶段是 model-level inner-loop training。基础 LLM 参数冻结,只训练每个 agent 的 inner RecursiveLink。论文把 ground-truth answer y 经过该 agent 的 input embedding layer 得到目标语义分布,然后让 inner link 输出的 latent thoughts 靠近这个分布。损失是 cosine regression:
L_in = 1 - cos(R_in(H), Emb_theta_i(y))
这个阶段的作用是让每个 agent 学会用 hidden state 继续 latent generation,而不必先解码成文本再重新编码。
第二阶段是 system-level outer-loop training。系统沿多 agent loop 展开 n 轮 recursion,最终只在最后一轮的最后一个 agent 处解码答案,然后用 cross-entropy 训练所有 outer RecursiveLink:
L_out = CE(S^(n)(S^(n-1)(...(S^(1)(x)))), y)
这个阶段的核心是全系统 credit assignment。由于 computation graph 沿递归路径保留,最终预测的误差信号可以反向传播到各个 outer link,使系统学习“哪些跨 agent latent transfer 对最终答案有贡献”。
4.7 算法流程
Input: question x, agents A1...AN, recursion rounds n, latent steps m
Stage 1: Inner-loop training
for each agent Ai:
freeze base LLM parameters
generate latent thoughts H with Ai
embed ground-truth answer y with Ai's embedding layer
train R_in_i using cosine regression
Stage 2: Outer-loop training
for each training sample (x, y):
initialize each agent with its instruction and question context
for recursion round r = 1...n:
for agent i = 1...N:
receive previous latent thoughts
align them through R_out
generate m-step latent thoughts with R_in
feed last agent's latent output back to first agent
decode final output from AN
train all R_out modules with CE loss on y
Inference:
run the same n-round latent recursion
decode only the final output from the last agent
4.8 Mermaid 方法流程
Mermaid 源码
flowchart LR
X["Question + role prompts"] --> A1["Agent A1 latent thoughts"]
A1 --> Rin1["Inner RecursiveLink"]
Rin1 --> Rout12["Outer RecursiveLink A1 -> A2"]
Rout12 --> A2["Agent A2 latent thoughts"]
A2 --> Rout2N["Outer RecursiveLink ..."]
Rout2N --> AN["Agent AN latent thoughts"]
AN --> Loop["feedback to A1 for next recursion round"]
Loop --> A1
AN --> Final["final round decode text answer"]4.9 理论分析
论文给出两个理论论证。
第一是 runtime complexity。文本式 Recursive MAS 每一步需要词表空间解码,包含 m |V| d_h 这类成本;RecursiveMAS 把该部分替换为 latent-space transformation m d_h^2。因为实际中 hidden dimension 远小于 vocabulary size,所以 latent transfer 更省计算。
第二是 gradient stability。文本式递归需要经过离散 token 或高置信 token 分布,梯度容易接近 0;RecursiveMAS 的 RecursiveLink 是连续可微映射,论文证明在其假设下可以保持近似稳定的梯度范数。这一结论支撑了“latent collaboration 比 text-mediated collaboration 更适合系统级训练”的主张。
5. 实验结果与分析
5.1 实验设置
论文在 9 个 benchmark 上测试 RecursiveMAS,覆盖数学、科学医学、代码生成和搜索问答。
| 类型 | 数据集 | 评价重点 |
|---|---|---|
| 数学推理 | MATH500, AIME2025, AIME2026 | 数值答案正确性,AIME 报告 Pass@10 |
| 科学医学 | GPQA-Diamond, MedQA | 多选题正确率 |
| 代码生成 | LiveCodeBench-v6, MBPP Plus | 代码执行测试通过率 |
| 搜索问答 | HotpotQA, Bamboogle | 多跳问答正确性,使用 LLM-as-a-judge |
模型配置覆盖 Qwen、Llama、Gemma、Mistral 等模型族。训练时冻结所有 LLM 参数,只更新 inner / outer RecursiveLink。训练数据来自 s1K、m1K、OpenCodeReasoning 和 ARPO-SFT。优化器为 AdamW,学习率 5e-4,batch size 为 4。

5.2 Baseline 设置
论文比较了三类 baseline。
第一类是 single-agent fine-tuning。包括对单个最终 agent 做 LoRA,以及 full supervised fine-tuning。
第二类是 representative MAS frameworks。包括 Mixture-of-Agents 和 TextGrad。
第三类是 recursion-based methods。包括单模型递归方法 LoopLM,以及与 RecursiveMAS 结构相同但使用文本通信的 Recursive-TextMAS。
这个 baseline 设计比较关键,因为它分别回答了三个问题:
- RecursiveMAS 是否优于训练单个 agent?
- RecursiveMAS 是否优于已有多智能体框架?
- RecursiveMAS 的提升是否来自 latent recursion,而不是仅仅来自多轮递归结构?
5.3 主要结果:递归深度带来性能和效率增益

r = 1, 2, 3 三种递归轮数下 RecursiveMAS 与 Recursive-TextMAS 的准确率、端到端时间和 token 使用量。核心现象是:递归越深,RecursiveMAS 相对文本递归 MAS 的优势越明显。论文报告的总体趋势包括:
r = 1 时,RecursiveMAS 平均准确率提升 3.4%,推理速度达到 1.2 倍,token 使用减少 34.6%。
r = 2 时,平均准确率提升 6.0%,推理速度达到 1.9 倍,token 使用减少 65.5%。
r = 3 时,平均准确率提升 7.2%,推理速度达到 2.4 倍,token 使用减少 75.6%。
这组结果支持论文的中心论点:当递归轮数增加时,文本式 MAS 的中间文本成本会快速累积,而 RecursiveMAS 因为大部分交互发生在 latent space,效率优势会随 recursion depth 放大。
5.4 与其他方法的整体比较

r = 3 下比较 RecursiveMAS 与多种方法。RecursiveMAS 在 MATH500、AIME2025、AIME2026、GPQA-Diamond、LiveCodeBench 和 MedQA 上均取得最高结果。几个关键数值是:
| 数据集 | RecursiveMAS | 最强对比方法大致水平 | 结论 |
|---|---|---|---|
| MATH500 | 88.0 | TextGrad 84.9 / Recursive-TextMAS 85.8 | 数学推理有稳定提升 |
| AIME2025 | 86.7 | Full-SFT 73.3 / TextGrad 73.3 | 高难数学提升很明显 |
| AIME2026 | 86.7 | Full-SFT / TextGrad / Recursive-TextMAS 约 73.3-76.7 | 泛化到新竞赛题仍有效 |
| GPQA-D | 66.2 | Full-SFT 62.8 / TextGrad 62.5 | 科学知识推理有中等提升 |
| LiveCodeBench | 42.9 | TextGrad 39.8 / Full-SFT 38.6 | 代码生成提升有限但稳定 |
| MedQA | 79.3 | TextGrad 77.2 / Full-SFT 77.0 | 医学问答提升较小 |
论文总结为:RecursiveMAS 相比每个 benchmark 上的最强 baseline 平均提升 8.3%。这个结果表明,提升不只是来自更强单模型,也不只是来自普通多 agent 框架,而是来自跨 agent latent collaboration 的系统级优化。
5.5 不同协作模式的泛化结果
论文进一步测试 Mixture、Distillation 和 Deliberation 三种模式。



5.6 效率分析:时间和 token


5.7 RecursiveLink 结构消融
论文比较了 1-layer、residual 1-layer、2-layer、residual 2-layer 四种 RecursiveLink。结果显示 residual 2-layer 最好,例如在 scaled sequential setting 下:
| RecursiveLink 设计 | Math500 | GPQA-D | LiveCodeBench |
|---|---|---|---|
| 1-Layer | 84.4 | 63.2 | 40.1 |
| Res + 1-Layer | 86.7 | 65.3 | 41.4 |
| 2-Layer | 85.6 | 64.5 | 40.5 |
| Res + 2-Layer | 88.0 | 66.2 | 42.9 |
这个消融说明 residual connection 不是装饰项,而是 RecursiveLink 稳定训练和保持语义的关键。单纯增加层数不如保留 residual semantics。
5.8 语义分布分析

5.9 latent thoughts 长度消融

m 的消融结果。性能随着 m 从 0 增加到 80 左右逐渐提升,之后基本饱和。论文测试了 transferred latent thoughts 长度 m。结果显示性能随着 m 从 0 增加到 80 左右逐渐提升,之后基本饱和。例如 LiveCodeBench 从 m=0 的 38.1 提升到 m=80 的 42.5,之后在 42.2-42.6 附近波动。
这个结果说明 RecursiveMAS 不需要无限增长 latent step;中等长度的 latent-thought budget 已经足以支撑有效协作。
5.10 训练成本分析

| 方法 | GPU memory | 可训练参数 | 估计成本 | 平均准确率 |
|---|---|---|---|---|
| LoRA Training | 21.67 GB | 15.92M (0.37%) | $6.64 | 66.9 |
| Full-SFT | 41.40 GB | 4.21B (100%) | $9.67 | 68.6 |
| RecursiveMAS | 15.29 GB | 13.12M (0.31%) | $4.27 | 74.9 |
这张表是论文工程价值最强的证据之一。RecursiveMAS 的训练对象只是轻量 RecursiveLink,因此参数量和显存低于 LoRA 与 Full-SFT,但平均准确率更高。不过这里也需要注意,成本估计依赖作者的具体实验设置和 GPU 使用方式,不能直接推广到所有 MAS 系统。
5.11 Case study
附录给了几个递归轮数案例。MATH500 的例子中,RecursiveMAS 在第 1 轮把 2^24 的 divisor 计数少算为 6;第 2 轮和第 3 轮修正为 7。这个案例说明递归 latent refinement 可能纠正早期错误,但它只是单例证据,不能单独证明机制普遍有效。
6. 总结
本文的核心贡献可以归纳为四点。
第一,提出 RecursiveMAS,把递归 scaling 从单个语言模型扩展到多智能体系统。它把每个 agent 看作系统递归计算中的一个模块,使 agent collaboration 本身可以多轮 refinement。
第二,提出 inner / outer RecursiveLink。inner link 支持 agent 内部 latent thoughts generation,outer link 支持异构 agent 之间的 hidden state transfer。这两个模块使系统可以避免大量中间文本解码。
第三,提出 inner-outer loop learning。内层训练让每个 agent 适应 latent generation,外层训练让整个 MAS loop 在最终答案监督下做系统级优化。基础 LLM 参数冻结,只训练轻量连接模块。
第四,在 9 个 benchmark 和 4 种 MAS collaboration pattern 上验证方法。实验显示 RecursiveMAS 在准确率、推理速度、token 使用量和训练成本上都优于若干 single-agent、MAS、recursive baseline。
本文最重要的启发是:多智能体系统的瓶颈不一定只在“agent 怎么分工”或“prompt 怎么写”,也在“agent 之间用什么介质通信”。如果通信介质从文本转向可训练的 latent representation,MAS 的递归协作可能获得新的效率和训练空间。
7. 个人思考与展望
7.1 优点
RecursiveMAS 的优点首先在于问题设定有价值。当前许多 MAS 框架大量依赖文本中间结果,随着 agent 数量和轮数增加,token、延迟和上下文污染都会成为实际瓶颈。本文直接针对通信介质本身做改造,比单纯换 prompt 或增加 agent 更有研究意义。
第二,方法设计相对克制。论文没有尝试训练所有 agent,也没有发明复杂的大型控制器,而是把可训练部分限制在 RecursiveLink。这使得方法的工程成本和理论分析都更清晰。
第三,实验覆盖面较广。数学、科学医学、代码、搜索问答,以及 sequential、mixture、distillation、deliberation 四种协作模式,都提供了一定证据说明该方法不是只在单一 pipeline 上有效。
7.2 局限性
第一,latent communication 的可解释性弱于文本通信。文本式 MAS 虽然昂贵,但中间推理可读;RecursiveMAS 的中间信息是 hidden states,难以人工检查每个 agent 到底传递了什么、丢失了什么、是否引入错误偏置。
第二,异构模型之间的 latent alignment 可能依赖具体模型族和训练数据。论文验证了多个模型族,但 RecursiveLink 是否能稳定扩展到闭源 API 模型、不同 tokenizer、不同架构或更大 agent 数量,还没有被充分证明。
第三,实验中的 search-based QA 使用 LLM-as-a-judge,存在评估不确定性。对于 HotpotQA 和 Bamboogle 这类任务,如果判断模型与被测模型生态接近,可能引入偏差。
第四,论文强调 token reduction,但真实部署成本还包括 hidden-state 传输、显存占用、batching、跨设备通信和工程集成成本。latent space 递归在单机实验中高效,不等于在分布式多 agent 服务里一定更便宜。
第五,理论分析依赖假设。梯度稳定性定理能说明 latent continuous mapping 在形式上优于文本离散化,但实际训练中仍会受到模型冻结、representation mismatch、序列长度和优化噪声影响。
7.3 可追问的问题
- RecursiveLink 传递的是最后一层 hidden state。是否中间层 hidden state、multi-layer state 或 attention KV cache 会更适合跨 agent 协作?
- 如果 agent 数量从 2-4 个扩展到 10 个以上,outer RecursiveLink 的数量、训练稳定性和误差累积会怎样变化?
- latent communication 是否会损害可控性和安全审计?文本中间过程可以检查,hidden-state 过程很难解释。
- RecursiveMAS 是否可以和文本通信混合使用,例如关键轮次保留文本解释,普通轮次使用 latent transfer?
- 对闭源 LLM API 来说,无法访问 hidden states,这种方法的应用边界在哪里?
7.4 后续研究方向
一个自然方向是研究 hybrid communication MAS:让 agent 在多数轮次使用 latent states 交流,但在关键决策点解码为文本供人类或 verifier 检查。这样可能在效率和可解释性之间取得平衡。
另一个方向是做更细粒度的 latent routing。当前 RecursiveMAS 主要通过固定 RecursiveLink 传递 latent thoughts,未来可以研究哪些 latent dimensions、哪些时间步、哪些 agent 信息真正需要传递,从而进一步减少冗余。
第三个方向是将 RecursiveMAS 与 verifier、tool execution、memory system 结合。特别是在代码生成和搜索问答场景,latent recursion 是否能和可验证工具反馈形成闭环,是一个值得继续验证的问题。
总体来看,这篇论文的贡献不只是提出一个新 MAS 框架,而是把“多智能体通信介质”本身变成了可训练对象。它的核心价值在于把 MAS 从文本编排层推进到 latent optimization 层,但其可解释性、工程可部署性和闭源模型适配仍是后续必须解决的问题。