01
Training-Free GRPO:无需参数训练的 Agent 优化
从参数化 Agent 训练的成本困境出发,使用组相对语义优势和经验库优化实现无需权重更新的持续改进。
论文精读、组会汇报与研究脉络,保留完整论证、实验依据和适用边界。
01
从参数化 Agent 训练的成本困境出发,使用组相对语义优势和经验库优化实现无需权重更新的持续改进。
02
AHE 通过可观测、可回滚的演化机制,让 Coding Agent 的 Harness 自动迭代并追踪每次修改的实际贡献。
03
聚焦自进化 Agent 的评估协议、过程指标、重放诊断与跨模型迁移,避免只看最终奖励。
04
从上下文适应的失败模式出发,理解结构化增量 Playbook 如何让 LLM 在不更新权重的情况下持续学习。
05
通过自监督方式生成工具调用训练数据,并用 loss-based filtering 保留真正有助于后续预测的 API 调用。
06
把 LLM 应用最容易失控的部分变成可设计、可测试、可暂停和可恢复的软件工程对象。
07
用 Coding Agent 自动搜索、修改和评估 LLM 应用 Harness,把人工 Harness Engineering 转化为代码空间优化问题。
08
将 LLM Agent 外部的运行时基础设施提升为研究对象,系统梳理执行、工具、上下文、状态、安全与评测。
09
让 LLM 自动合成代码 Harness,用可执行程序补齐 Agent 在动作合法性和环境接口上的短板。
10
将递归语言模型的 latent computation 思想扩展到多智能体系统,让异构 Agent 在隐藏状态空间中递归协作。
11
面向长程任务压缩不断增长的上下文,并通过失败轨迹持续优化信息保留规则。