Paper Report

Recursive Multi-Agent Systems 论文汇报

把递归语言模型的 latent computation 思想扩展到多智能体系统,通过 RecursiveLink 让异构 agent 在隐藏状态空间中递归协作。

核心问题多 agent 协作是否能通过 latent-space recursion scale。
关键机制inner / outer RecursiveLink 连接 agent 内部与跨 agent 表示。
实验覆盖9 个 benchmark,4 种 MAS collaboration pattern。
主要结论平均准确率提升 8.3%,并降低推理时间与 token 使用。

1. 论文基本信息

  • 论文标题:Recursive Multi-Agent Systems
  • 作者:Xiyuan Yang, Jiaru Zou, Rui Pan, Ruizhong Qiu, Pan Lu, Shizhe Diao, Jindong Jiang, Hanghang Tong, Tong Zhang, Markus J. Buehler, Jingrui He, James Zou
  • 机构:UIUC, Stanford University, NVIDIA, MIT
  • 版本:arXiv:2604.25917v1
  • 时间:2026 年 4 月 28 日
  • 项目主页:https://recursivemas.github.io
  • 本文提出 RecursiveMAS,把“递归语言模型”中反复复用同一计算、逐步加深推理的思想扩展到多智能体系统。它不再让多个 agent 通过文本轮流交流,而是让 agent 在 latent space 中传递隐藏状态,并通过轻量的 RecursiveLink 模块把整个多智能体系统组织成一个可训练的递归循环。论文声称,相比文本式多智能体递归,RecursiveMAS 同时提升准确率、降低 token 使用量,并加快端到端推理。

2. 提纲 / 背景

2.1 背景:多智能体系统的扩展问题

大语言模型在复杂任务上常见瓶颈包括模型容量有限、单次生成短视、探索解空间效率不足。多智能体系统(MAS)试图把多个具有不同角色或专长的模型组织起来,例如 Planner、Critic、Solver 的顺序管线,或者数学、代码、科学专家的混合协作。

这类系统的核心假设是:单个模型不一定足以解决复杂任务,但多个模型通过分工、反馈和集成可以形成更强的系统能力。

现有 MAS 主要有两类改进路线:

  • 文本层面的 prompt / context 迭代:通过自然语言反馈、更新 prompt、改进共享上下文来协调 agent。
  • 模型层面的训练:分别微调某些 agent,或者训练角色特定输出。

这两类方法都有局限。文本交互会产生大量中间 token,递归轮数增加后延迟和 token 成本迅速上升;分别训练每个 agent 又难以把整个系统作为统一目标进行优化。

2.2 背景:递归语言模型提供了另一条 scaling 轴

递归语言模型(Recursive Language Models, RLMs)的思路是:不只是增加参数量或 token 长度,而是让同一组计算层在 latent state 上反复作用,从而增加推理深度。直观上,模型可以在连续表征空间中多轮 refinement,而不必每一步都解码成文本。

本文把这个思想迁移到 MAS:如果单个模型可以通过递归 latent computation 加深推理,那么多智能体协作本身是否也能通过递归来 scale?

2.3 本文定位

本文的定位不是提出一个新的单模型推理结构,而是提出一个系统级 agentic recursion 框架。RecursiveMAS 试图回答:

  • 如何让多个异构 agent 在 latent space 中递归协作?
  • 如何只训练轻量连接模块,而不是更新所有 LLM 参数?
  • latent-space 协作相比 text-mediated 协作是否更快、更省 token、更容易训练?
  • 这种机制是否能泛化到不同 MAS 协作模式?

3. 研究问题与目标

3.1 研究问题

本文的核心研究问题是:

能否把多智能体系统看作一个统一的递归计算图,并通过 latent-state transfer 实现更高效、更可训练的 agent collaboration scaling?

更具体地说,论文要解决的是传统 MAS 中的三个问题。

第一,文本通信成本高。标准 MAS 常让每个 agent 输出完整文本,再把文本传给下一个 agent。递归轮数越多,中间文本越多,解码和上下文处理成本越高。

第二,系统级训练困难。如果每个 agent 都是完整 LLM,直接训练所有参数成本高;如果只训练单个 agent,又不能真正优化跨 agent 的协作链路。

第三,文本交互不利于端到端梯度传播。文本 token 采样或离散化会让递归链路中的梯度信号变弱,难以对整个系统做统一 credit assignment。

3.2 工作目标

RecursiveMAS 的目标可以概括为四点:

  • 用 latent thoughts 替代中间文本,让 agent 在隐藏状态层面传递信息。
  • 用轻量 RecursiveLink 连接 agent 内部和 agent 之间的表示空间。
  • 冻结所有基础 LLM,只训练 inner / outer RecursiveLink,降低训练成本。
  • 通过 inner-outer loop learning 对整个 MAS 递归链路做统一优化。

本文最终希望证明:递归不只是单模型的 scaling 方式,也可以成为多智能体协作的系统级 scaling 方式。

4. 核心方法 / 模型

4.1 方法总览

RecursiveMAS 把一个多智能体系统组织成一个 latent-space recursion loop。每个 agent 不再在每轮都输出完整中间文本,而是在自己的 Transformer hidden states 中生成一段连续的 latent thoughts,再通过 RecursiveLink 传给下一个 agent。最后一个 agent 的 latent output 会在中间轮次回传给第一个 agent,形成递归循环;只有最终递归轮的最后一个 agent 才解码出文本答案。

Figure 2
image-20260508110133023
Figure 2 展示了 RecursiveMAS 的基本信息流:每个 agent 先通过 inner RecursiveLink 在自身内部生成 latent thoughts,再通过 outer RecursiveLink 把这些 hidden representations 对齐到下一个 agent 的输入空间。最后一个 agent 的 latent thoughts 回到第一个 agent,形成多轮 loop。该图证明的是:RecursiveMAS 的“递归”发生在多 agent 系统的信息流上,而不是只发生在单个模型内部。

RecursiveLink 是本文最关键的结构组件。它负责把一个表示空间中的 hidden state 转换到另一个表示空间,使 latent thoughts 可以继续被模型消费。

论文定义了两类 RecursiveLink。

第一类是 inner RecursiveLink。它在单个 agent 内部使用,把模型刚生成的 last-layer hidden state 映射回该 agent 的 input embedding space,从而支持下一步 latent generation。公式为:

R_in(h) = h + W2 * GELU(W1 * h)

这里的 residual connection 保留原始 latent semantics,MLP 分支学习从 last-layer hidden state 到 input embedding distribution 的偏移。

第二类是 outer RecursiveLink。它在不同 agent 之间使用,解决异构模型 hidden dimension 或 embedding distribution 不一致的问题。公式为:

R_out(h) = W3 * h + W2 * GELU(W1 * h)

其中 W3 把源 agent 的 hidden state 映射到目标 agent 的 embedding space。相比 inner link,outer link 多了一个 residual branch 上的线性投影。

Figure 3
image-20260508110405259
Figure 3 展示了 RecursiveLink 的两种形态。它支持本文的一个关键设计判断:连接模块不应从零学习完整语义变换,而应保留已有 hidden semantics,只学习不同分布之间的 alignment。

4.3 Agent 内部的 latent thoughts generation

给定问题和 agent-specific instruction 的输入 embedding,agent 首先正常前向得到最后一层 hidden state h_t。不同于标准自回归解码,RecursiveMAS 不把 h_t 投影到词表并采样 token,而是用 inner RecursiveLink 得到下一步输入 embedding:

e_{t+1} = R_in(h_t)

这个过程重复 m 步,得到一段连续 latent thoughts:

H_A = [h_t, h_{t+1}, ..., h_{t+m}]

这段 latent thoughts 相当于 agent 的内部思考轨迹,但它不经过文本解码,因此避免了中间 token 生成成本。

4.4 Agent 之间的 latent interaction

当 agent A1 完成 latent thoughts generation 后,它的 latent thoughts 会经过 outer RecursiveLink 转换到 agent A2 的 embedding space。A2 的输入由两部分组成:

E_A2 ⊕ R_out(H_A1)

也就是自身原始上下文 embedding 加上来自前一个 agent 的 latent information。这个过程沿着所有 agent 依次进行。最后一个 agent 完成 latent generation 后,其 latent output 会被传回第一个 agent,进入下一轮 recursion。

这种设计使得不同 agent 可以在连续表示空间中交换信息,而不是通过“Planner 写一段话,Critic 再读这段话,Solver 再读 Critic 的话”的显式文本方式协作。

4.5 支持的四种多智能体协作模式

RecursiveMAS 不绑定单一 MAS 拓扑。论文实例化了四种协作模式。

协作模式agent 角色机制含义
Sequential StylePlanner, Critic, Solver顺序分解、批评、修正、求解
Mixture StyleMath / Code / Science Specialist, Summarizer多领域专家并行推理,再由汇总者聚合
Distillation StyleExpert, Learner大模型专家向小模型学习者传递能力
Deliberation StyleReflector, Tool-Caller反思 agent 与工具调用 agent 递归协作

这一设计的意义是:RecursiveMAS 不是一个只适用于 Planner-Critic-Solver 的 pipeline trick,而是试图成为一种结构无关的 latent collaboration interface。

4.6 训练流程:inner-outer loop learning

RecursiveMAS 的训练分两阶段。

Figure 4
image-20260508110426104
Figure 4 展示了两阶段训练流程。第一阶段分别 warm up 每个 agent 的 inner link;第二阶段把整个 MAS loop 展开多轮 recursion,通过最终答案的损失来训练跨 agent 的 outer link。

第一阶段是 model-level inner-loop training。基础 LLM 参数冻结,只训练每个 agent 的 inner RecursiveLink。论文把 ground-truth answer y 经过该 agent 的 input embedding layer 得到目标语义分布,然后让 inner link 输出的 latent thoughts 靠近这个分布。损失是 cosine regression:

L_in = 1 - cos(R_in(H), Emb_theta_i(y))

这个阶段的作用是让每个 agent 学会用 hidden state 继续 latent generation,而不必先解码成文本再重新编码。

第二阶段是 system-level outer-loop training。系统沿多 agent loop 展开 n 轮 recursion,最终只在最后一轮的最后一个 agent 处解码答案,然后用 cross-entropy 训练所有 outer RecursiveLink:

L_out = CE(S^(n)(S^(n-1)(...(S^(1)(x)))), y)

这个阶段的核心是全系统 credit assignment。由于 computation graph 沿递归路径保留,最终预测的误差信号可以反向传播到各个 outer link,使系统学习“哪些跨 agent latent transfer 对最终答案有贡献”。

4.7 算法流程

Input: question x, agents A1...AN, recursion rounds n, latent steps m

Stage 1: Inner-loop training
for each agent Ai:
    freeze base LLM parameters
    generate latent thoughts H with Ai
    embed ground-truth answer y with Ai's embedding layer
    train R_in_i using cosine regression

Stage 2: Outer-loop training
for each training sample (x, y):
    initialize each agent with its instruction and question context
    for recursion round r = 1...n:
        for agent i = 1...N:
            receive previous latent thoughts
            align them through R_out
            generate m-step latent thoughts with R_in
        feed last agent's latent output back to first agent
    decode final output from AN
    train all R_out modules with CE loss on y

Inference:
    run the same n-round latent recursion
    decode only the final output from the last agent

4.8 Mermaid 方法流程

输入Question + role prompts
Agent A1生成 latent thoughts
Inner Link同一 agent 内部续写 latent state
Outer Link对齐到下一个 agent 的 embedding space
Agent AN多 agent latent 协作
递归回传进入下一轮 recursion
最终解码最后一轮输出文本答案
Mermaid 源码
flowchart LR
    X["Question + role prompts"] --> A1["Agent A1 latent thoughts"]
    A1 --> Rin1["Inner RecursiveLink"]
    Rin1 --> Rout12["Outer RecursiveLink A1 -> A2"]
    Rout12 --> A2["Agent A2 latent thoughts"]
    A2 --> Rout2N["Outer RecursiveLink ..."]
    Rout2N --> AN["Agent AN latent thoughts"]
    AN --> Loop["feedback to A1 for next recursion round"]
    Loop --> A1
    AN --> Final["final round decode text answer"]

4.9 理论分析

论文给出两个理论论证。

第一是 runtime complexity。文本式 Recursive MAS 每一步需要词表空间解码,包含 m |V| d_h 这类成本;RecursiveMAS 把该部分替换为 latent-space transformation m d_h^2。因为实际中 hidden dimension 远小于 vocabulary size,所以 latent transfer 更省计算。

第二是 gradient stability。文本式递归需要经过离散 token 或高置信 token 分布,梯度容易接近 0;RecursiveMAS 的 RecursiveLink 是连续可微映射,论文证明在其假设下可以保持近似稳定的梯度范数。这一结论支撑了“latent collaboration 比 text-mediated collaboration 更适合系统级训练”的主张。

5. 实验结果与分析

5.1 实验设置

论文在 9 个 benchmark 上测试 RecursiveMAS,覆盖数学、科学医学、代码生成和搜索问答。

类型数据集评价重点
数学推理MATH500, AIME2025, AIME2026数值答案正确性,AIME 报告 Pass@10
科学医学GPQA-Diamond, MedQA多选题正确率
代码生成LiveCodeBench-v6, MBPP Plus代码执行测试通过率
搜索问答HotpotQA, Bamboogle多跳问答正确性,使用 LLM-as-a-judge

模型配置覆盖 Qwen、Llama、Gemma、Mistral 等模型族。训练时冻结所有 LLM 参数,只更新 inner / outer RecursiveLink。训练数据来自 s1K、m1K、OpenCodeReasoning 和 ARPO-SFT。优化器为 AdamW,学习率 5e-4,batch size 为 4。

Table 1
image-20260508110519447
Table 1 说明了不同 MAS pattern 的 agent 选择。例如轻量顺序模式使用 Qwen3-1.7B、Llama3.2-1B-Instruct 和 Qwen2.5-Math-1.5B-Instruct;scaled 顺序模式使用 Gemma3-4B-it、Llama3.2-3B-Instruct 和 Qwen3.5-4B;distillation 模式用 Qwen3.5-9B 作为 Expert、Qwen3.5-4B 作为 Learner。

5.2 Baseline 设置

论文比较了三类 baseline。

第一类是 single-agent fine-tuning。包括对单个最终 agent 做 LoRA,以及 full supervised fine-tuning。

第二类是 representative MAS frameworks。包括 Mixture-of-Agents 和 TextGrad。

第三类是 recursion-based methods。包括单模型递归方法 LoopLM,以及与 RecursiveMAS 结构相同但使用文本通信的 Recursive-TextMAS。

这个 baseline 设计比较关键,因为它分别回答了三个问题:

  • RecursiveMAS 是否优于训练单个 agent?
  • RecursiveMAS 是否优于已有多智能体框架?
  • RecursiveMAS 的提升是否来自 latent recursion,而不是仅仅来自多轮递归结构?

5.3 主要结果:递归深度带来性能和效率增益

Table 2
image-20260508110539371
Table 2 比较了 r = 1, 2, 3 三种递归轮数下 RecursiveMAS 与 Recursive-TextMAS 的准确率、端到端时间和 token 使用量。核心现象是:递归越深,RecursiveMAS 相对文本递归 MAS 的优势越明显。

论文报告的总体趋势包括:

r = 1 时,RecursiveMAS 平均准确率提升 3.4%,推理速度达到 1.2 倍,token 使用减少 34.6%。

r = 2 时,平均准确率提升 6.0%,推理速度达到 1.9 倍,token 使用减少 65.5%。

r = 3 时,平均准确率提升 7.2%,推理速度达到 2.4 倍,token 使用减少 75.6%。

这组结果支持论文的中心论点:当递归轮数增加时,文本式 MAS 的中间文本成本会快速累积,而 RecursiveMAS 因为大部分交互发生在 latent space,效率优势会随 recursion depth 放大。

5.4 与其他方法的整体比较

Table 3
image-20260508110558341
Table 3 在 r = 3 下比较 RecursiveMAS 与多种方法。RecursiveMAS 在 MATH500、AIME2025、AIME2026、GPQA-Diamond、LiveCodeBench 和 MedQA 上均取得最高结果。

几个关键数值是:

数据集RecursiveMAS最强对比方法大致水平结论
MATH50088.0TextGrad 84.9 / Recursive-TextMAS 85.8数学推理有稳定提升
AIME202586.7Full-SFT 73.3 / TextGrad 73.3高难数学提升很明显
AIME202686.7Full-SFT / TextGrad / Recursive-TextMAS 约 73.3-76.7泛化到新竞赛题仍有效
GPQA-D66.2Full-SFT 62.8 / TextGrad 62.5科学知识推理有中等提升
LiveCodeBench42.9TextGrad 39.8 / Full-SFT 38.6代码生成提升有限但稳定
MedQA79.3TextGrad 77.2 / Full-SFT 77.0医学问答提升较小

论文总结为:RecursiveMAS 相比每个 benchmark 上的最强 baseline 平均提升 8.3%。这个结果表明,提升不只是来自更强单模型,也不只是来自普通多 agent 框架,而是来自跨 agent latent collaboration 的系统级优化。

5.5 不同协作模式的泛化结果

论文进一步测试 Mixture、Distillation 和 Deliberation 三种模式。

Table 6
image-20260508110627506
Table 6 显示,RecursiveMAS 相比 Learner 平均提升 8.0%,同时相比 Expert 保留 1.5 倍端到端速度优势。这说明 RecursiveMAS 的 distillation-style 不只是“让小模型模仿大模型”,而是让 Expert 和 Learner 通过 latent recursion 形成一个更高效的系统。
Table 7
image-20260508110654403
Table 7 显示,在 mixture-style 下,RecursiveMAS 相比最强单个专家仍有提升。例如 MedQA 上 Science Specialist 为 48.1,RecursiveMAS 达到 61.7。这说明 latent aggregation 能够形成跨领域互补,而不是简单选择一个专家。
Table 8
image-20260508110705204
Table 8 显示,deliberation-style 下 RecursiveMAS 在 AIME2026、GPQA-Diamond、HotpotQA 和 Bamboogle 上均超过 Reflector 或 Tool-Caller 单体。工具调用场景中,RecursiveMAS 不只是替代工具,而是让 Reflector 和 Tool-Caller 通过递归 latent interaction 改进最终解答。

5.6 效率分析:时间和 token

Figure 5
image-20260508110738575
Figure 5 显示 RecursiveMAS 的平均推理加速随递归轮数从 1.2 倍增长到 2.4 倍。这个结果与复杂度分析一致:递归轮数越多,避免中间文本解码的收益越大。
Figure 6
image-20260508110748945
Figure 6 显示 token 使用减少从 34.6% 增长到 75.6%。该图直接支撑了本文最实用的价值点:如果 MAS 需要多轮协作,文本通信不是免费中间表示,latent communication 能显著降低 token overhead。

论文比较了 1-layer、residual 1-layer、2-layer、residual 2-layer 四种 RecursiveLink。结果显示 residual 2-layer 最好,例如在 scaled sequential setting 下:

RecursiveLink 设计Math500GPQA-DLiveCodeBench
1-Layer84.463.240.1
Res + 1-Layer86.765.341.4
2-Layer85.664.540.5
Res + 2-Layer88.066.242.9

这个消融说明 residual connection 不是装饰项,而是 RecursiveLink 稳定训练和保持语义的关键。单纯增加层数不如保留 residual semantics。

5.8 语义分布分析

Figure 7
image-20260508110840326
Figure 7 把 RecursiveMAS 生成答案和 ground truth answer 的 embedding 分布做 PCA 可视化。随着递归轮数从 1 增加到 3,生成答案分布逐渐靠近 ground truth 分布。该图的作用是补充说明 latent thoughts 不是无意义中间向量,而是携带了可逐步修正的语义信息。

5.9 latent thoughts 长度消融

Figure 8
Figure 8 latent thoughts length ablation
Figure 8 展示了 transferred latent thoughts 长度 m 的消融结果。性能随着 m 从 0 增加到 80 左右逐渐提升,之后基本饱和。

论文测试了 transferred latent thoughts 长度 m。结果显示性能随着 m 从 0 增加到 80 左右逐渐提升,之后基本饱和。例如 LiveCodeBench 从 m=0 的 38.1 提升到 m=80 的 42.5,之后在 42.2-42.6 附近波动。

这个结果说明 RecursiveMAS 不需要无限增长 latent step;中等长度的 latent-thought budget 已经足以支撑有效协作。

5.10 训练成本分析

Table 5
image-20260508110942740
Table 5 比较了训练成本:
方法GPU memory可训练参数估计成本平均准确率
LoRA Training21.67 GB15.92M (0.37%)$6.6466.9
Full-SFT41.40 GB4.21B (100%)$9.6768.6
RecursiveMAS15.29 GB13.12M (0.31%)$4.2774.9

这张表是论文工程价值最强的证据之一。RecursiveMAS 的训练对象只是轻量 RecursiveLink,因此参数量和显存低于 LoRA 与 Full-SFT,但平均准确率更高。不过这里也需要注意,成本估计依赖作者的具体实验设置和 GPU 使用方式,不能直接推广到所有 MAS 系统。

5.11 Case study

附录给了几个递归轮数案例。MATH500 的例子中,RecursiveMAS 在第 1 轮把 2^24 的 divisor 计数少算为 6;第 2 轮和第 3 轮修正为 7。这个案例说明递归 latent refinement 可能纠正早期错误,但它只是单例证据,不能单独证明机制普遍有效。

6. 总结

本文的核心贡献可以归纳为四点。

第一,提出 RecursiveMAS,把递归 scaling 从单个语言模型扩展到多智能体系统。它把每个 agent 看作系统递归计算中的一个模块,使 agent collaboration 本身可以多轮 refinement。

第二,提出 inner / outer RecursiveLink。inner link 支持 agent 内部 latent thoughts generation,outer link 支持异构 agent 之间的 hidden state transfer。这两个模块使系统可以避免大量中间文本解码。

第三,提出 inner-outer loop learning。内层训练让每个 agent 适应 latent generation,外层训练让整个 MAS loop 在最终答案监督下做系统级优化。基础 LLM 参数冻结,只训练轻量连接模块。

第四,在 9 个 benchmark 和 4 种 MAS collaboration pattern 上验证方法。实验显示 RecursiveMAS 在准确率、推理速度、token 使用量和训练成本上都优于若干 single-agent、MAS、recursive baseline。

本文最重要的启发是:多智能体系统的瓶颈不一定只在“agent 怎么分工”或“prompt 怎么写”,也在“agent 之间用什么介质通信”。如果通信介质从文本转向可训练的 latent representation,MAS 的递归协作可能获得新的效率和训练空间。

7. 个人思考与展望

7.1 优点

RecursiveMAS 的优点首先在于问题设定有价值。当前许多 MAS 框架大量依赖文本中间结果,随着 agent 数量和轮数增加,token、延迟和上下文污染都会成为实际瓶颈。本文直接针对通信介质本身做改造,比单纯换 prompt 或增加 agent 更有研究意义。

第二,方法设计相对克制。论文没有尝试训练所有 agent,也没有发明复杂的大型控制器,而是把可训练部分限制在 RecursiveLink。这使得方法的工程成本和理论分析都更清晰。

第三,实验覆盖面较广。数学、科学医学、代码、搜索问答,以及 sequential、mixture、distillation、deliberation 四种协作模式,都提供了一定证据说明该方法不是只在单一 pipeline 上有效。

7.2 局限性

第一,latent communication 的可解释性弱于文本通信。文本式 MAS 虽然昂贵,但中间推理可读;RecursiveMAS 的中间信息是 hidden states,难以人工检查每个 agent 到底传递了什么、丢失了什么、是否引入错误偏置。

第二,异构模型之间的 latent alignment 可能依赖具体模型族和训练数据。论文验证了多个模型族,但 RecursiveLink 是否能稳定扩展到闭源 API 模型、不同 tokenizer、不同架构或更大 agent 数量,还没有被充分证明。

第三,实验中的 search-based QA 使用 LLM-as-a-judge,存在评估不确定性。对于 HotpotQA 和 Bamboogle 这类任务,如果判断模型与被测模型生态接近,可能引入偏差。

第四,论文强调 token reduction,但真实部署成本还包括 hidden-state 传输、显存占用、batching、跨设备通信和工程集成成本。latent space 递归在单机实验中高效,不等于在分布式多 agent 服务里一定更便宜。

第五,理论分析依赖假设。梯度稳定性定理能说明 latent continuous mapping 在形式上优于文本离散化,但实际训练中仍会受到模型冻结、representation mismatch、序列长度和优化噪声影响。

7.3 可追问的问题

  • RecursiveLink 传递的是最后一层 hidden state。是否中间层 hidden state、multi-layer state 或 attention KV cache 会更适合跨 agent 协作?
  • 如果 agent 数量从 2-4 个扩展到 10 个以上,outer RecursiveLink 的数量、训练稳定性和误差累积会怎样变化?
  • latent communication 是否会损害可控性和安全审计?文本中间过程可以检查,hidden-state 过程很难解释。
  • RecursiveMAS 是否可以和文本通信混合使用,例如关键轮次保留文本解释,普通轮次使用 latent transfer?
  • 对闭源 LLM API 来说,无法访问 hidden states,这种方法的应用边界在哪里?

7.4 后续研究方向

一个自然方向是研究 hybrid communication MAS:让 agent 在多数轮次使用 latent states 交流,但在关键决策点解码为文本供人类或 verifier 检查。这样可能在效率和可解释性之间取得平衡。

另一个方向是做更细粒度的 latent routing。当前 RecursiveMAS 主要通过固定 RecursiveLink 传递 latent thoughts,未来可以研究哪些 latent dimensions、哪些时间步、哪些 agent 信息真正需要传递,从而进一步减少冗余。

第三个方向是将 RecursiveMAS 与 verifier、tool execution、memory system 结合。特别是在代码生成和搜索问答场景,latent recursion 是否能和可验证工具反馈形成闭环,是一个值得继续验证的问题。

总体来看,这篇论文的贡献不只是提出一个新 MAS 框架,而是把“多智能体通信介质”本身变成了可训练对象。它的核心价值在于把 MAS 从文本编排层推进到 latent optimization 层,但其可解释性、工程可部署性和闭源模型适配仍是后续必须解决的问题。