RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
作者:Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen, Yufan Zhuang, Yoonho Lee, Chengsong Huang, Han Yu, Zhongying CuiZhu, Yifei Ming, Huaxiu Yao, Burak Gokturk, Tomas Pfister, Chen-Yu Lee
核心发表机构:Google Cloud AI Research、UNC-Chapel Hill、Stanford University、Washington University in St. Louis
论文链接:arXiv:2609.24972v2
发布于:arXiv 预印本(cs.LG)
|—😐—😐—😐—😐
|T TT| evolution rounds | 20 | 20 | 40 |
|k kk| trials per task per evaluation | 2 | 2 | 4 |
|δ \deltaδ| empirical noise tolerance | 0.017 | 0.004 | 0.020 |
|b min b_{\min}bmin| final-round edit budget | 1 | 1 | 1 |
|b max b_{\max}bmax| initial edit budget | 4 | 3 | 4 |
|w ww| stall-detection window | 3 | 3 | 3 |
|m d r a f t m_{\mathrm{draft}}mdraft| reserved exploratory proposals | 1 | 1 | 1 |
|n p r u n e n_{\mathrm{prune}}nprune| pruning window | 4 | 4 | 5 |
|β 0 \beta_0β0| base cost allowance | 0.10 | 0.10 | 0.15 |
|β 1 \beta_1β1| gain-dependent cost allowance | 44.5 | 35.4 | 24.4 |
单位方面,scoreS ^ \hat SS^是[ 0 , 1 ] [0,1][0,1]的分数,Δ C \Delta CΔC是 policy tokens per trial 的相对变化,因此δ \deltaδ和β 1 \beta_1β1用这些单位表示。Coding instance 中,δ \deltaδ对应 89 ×k kk= 178 trials 中的 3 passes;agentic workspace instance 中,δ \deltaδ对应约 14,100 criterion verdicts 中的 60 criteria;engineering design instance 中,δ \deltaδ对应 61 ×k kk= 244 trials 中的 5 passes。β 1 \beta_1β1对应:coding 每额外一次 pass 允许 25% token;agentic workspace 每额外 100 criteria 允许 25% token;engineering design 每额外一次 pass 允许 10% token。
四、实验 / Experiments
4.1 数据集与评估指标 / Datasets & Metrics
实验覆盖八个 benchmark,横跨 coding、agentic workspace 与 engineering design 三个领域。评估原则是:harness 与其 baseline 总在同一窗口、同一工具环境、同一 judge、同样 trials 数下评估。五个 OOD 面包括 SWE-bench Verified、JobBench、GDPval、APEX-Agents 与 Frontier-Eng;其中 Frontier-Eng 仅作为 out-of-distribution 测试面。
| Benchmark | 领域/角色 | 任务与评分 | 指标 |
|---|---|---|---|
| Terminal-Bench 2.1 | coding, evolve | 每个任务是 container image,含 task description、working directory、hidden unit tests;agent 通过 harness 驱动真实 shell;任务解决仅当 agent 停止后任务自己的测试套件通过 | 89 个任务中解决比例,即 accuracy |
| SWE-bench Verified | coding, OOD | 每个实例是真实 GitHub issue 与报告时 repository snapshot 配对;agent 产生 patch,检查 fail-to-pass 与 pass-to-pass 测试 | 同时满足两者的实例比例,即 resolve rate |
| Harvey LAB | agentic workspace, ID evolve/held-out | 每个任务提供 Word、Excel、PDF 源文档文件夹,要求产生 deliverable;严格 per-criterion rubric,每任务 20 到 100 个独立 judged criteria,约 14,000 criterion verdicts;LLM judge 为 Gemini-3.5-Flash | 所有任务通过 criteria 的比例;160 个任务固定划分为 120-task evolve set 与 40-task held-out set |
| JobBench | agentic workspace, OOD | 任务来自真实专业工作流,含 task folder、input files、wrapper prompt;参考材料故意 withheld;harness 暴露 filesystem、code execution、grounded web search | benchmark 自己的 weighted rubric score;judge 取 Gemini-3.5-Flash 与 Claude Opus 4.8 的平均 |
| GDPval | agentic workspace, OOD | 每个任务将 harness 产出与人类专家 deliverable 并排;三位 judge 组成 panel:Qwen3.6-35B-A3B、Claude Sonnet 4.6、Gemini-3.1 Pro;每对以两种 presentation orders 判断,任务 verdict 为多数投票 | 对 185 个任务的 win rate against the expert;每个 judge 每个 harness 发出 204 次比较 |
| APEX-Agents | agentic workspace, OOD | 每个任务把 agent 放入 sandboxed world,有自身 MCP tool surface,覆盖 filesystem、PDF reading、spreadsheets、mail、chat、calendar、documents、code execution;per-task rubric,LLM judge 为 Gemini-3.5-Flash | 完整 480 个任务的 pass@1;基础设施失败导致 rollout 缺失计为失败,不排除 |
| EngDesign | engineering design, evolve | 使用 license-free subset,取 61 个无需 proprietary simulators 的任务;每个任务陈述 design goal 与物理约束;由 frozen simulation 或 testbench 评分 | 确定性 grading;所有 61 个任务都用于 evolution,无 in-distribution held-out split |
| Frontier-Eng | engineering design, OOD | 收集 26 个领域的真实工程优化问题;每个任务要求产生 design 或 program,由 frozen task-specific simulator/evaluator 在连续目标上评分 | Medal Score:冻结 v1 snapshot 的三个最佳可行结果为 gold、silver、bronze 阈值;提交达到阈值分别得 1、0.67、0.33;47 个任务平均,38 个贡献 credit |
评估指标中的S ^ \hat SS^是[ 0 , 1 ] [0,1][0,1]的 measured score。Δ C \Delta CΔC是 policy tokens per trial 的相对变化。Harvey LAB、JobBench、GDPval 使用 LLM judge,因此论文用 EngDesign 与 Frontier-Eng 的确定性评分来检验收益是否能在无 judge 偏差路径下保持。所有任务在 arms 之间拆除重建容器或环境,避免状态携带;APEX-Agents 对基础设施失败的 rollout 也计为失败,防止崩溃的 harness 因缺失数据看起来更好。
4.2 主实验结果 / Main Results
摘要报告:跨八个 benchmark,RRSI 在其演化的 split 上最多提升 14.1 分,在五个 OOD benchmark 上最多提升 4.7 分,同时产生比无正则化演化少用 30% policy tokens 的 harness。下图汇总三个领域的主结果。
在 coding domain 中,论文分别用两个不同家族 policy 从相同 coding harness 开始,只在 Terminal-Bench 2.1 上演化,然后在 evolve benchmark 与 SWE-bench Verified 上评估。结果如下:
| Policy | Benchmark | H 0 H_0H0 | RRSI | Δ \DeltaΔ |
|---|---|---|---|---|
| Claude Opus 4.8 | Terminal-Bench 2.1 (Evolve) | 74.2 | 80.2 | +6.0 |
| Claude Opus 4.8 | SWE-bench Verified (OOD) | 82.0 | 83.8 | +1.8 |
| Gemini 3.5 Flash | Terminal-Bench 2.1 (Evolve) | 64.6 | 78.7 | +14.1 |
| Gemini 3.5 Flash | SWE-bench Verified (OOD) | 76.8 | 79.0 | +2.2 |
这说明 RRSI 不绑定单一 policy family。对于较强 policy Claude Opus 4.8,起点已接近两个 suite 的上限,增益空间更小;对于 Gemini 3.5 Flash,evolve split 提升 14.1 分,OOD SWE-bench Verified 也提升 2.2 分。关键是,harness 从未在 SWE-bench Verified 上被评分,却改进了该未见 benchmark,说明收益不特定于某一 backbone。
跨模型迁移进一步支持这一点。论文取 coding run 的最终 harness,用 Gemini 3.5 Flash 演化,然后用从未参与搜索的 Gemini 3.1 Flash Lite 原样评估:
| Evaluation policy | H 0 H_0H0 | RRSI | Δ \DeltaΔ |
|---|---|---|---|
| Gemini 3.5 Flash(搜索 policy) | 64.6 | 78.7 | +14.1 |
| Gemini 3.1 Flash Lite(未见) | 11.2 | 14.6 | +3.4 |
Terminal-Bench 2.1 accuracy 从 11.2 提升到 14.6,相对提升 30.4%;base 分数不到搜索 policy 的五分之一。绝对增益更小,因为较弱 backbone 能触达的任务更少,但机制并不完全依赖搜索时所用 policy 的能力水平。Harness 是程序,不是权重集合;若机制只帮助搜索时所用 policy,它就只是该 policy 的 artifact,而非可复用机制。这里的迁移结果表明,至少部分被保留的编辑具有跨 policy 的可复用性。
在 agentic workspace 的消融表中,RRSI 的 OOD Avg. 为 43.6,高于未演化 harness 的 39.7、无正则化演化的 40.3、去掉 proposal regularizers 的 41.9 和去掉 acceptance regularizers 的 41.0;其 evolve split 分数为 90.5,ID held-out 为 89.2,且 token 成本为 2.42 million/trial,低于无正则化演化的 3.80。这些数值将在下一节结合消融机制展开。
4.3 消融实验 / Ablation Study
论文在 agentic workspace tasks 上对 proposal-side 与 acceptance-side 正则化做消融。OOD Avg. 是 JobBench、GDPval、APEX-Agents 的平均。
| Variant | Harvey LAB (Evolve) | Harvey LAB (ID Held-out) | OOD Avg. | Tokens/trial (m) ↓ |
|---|---|---|---|---|
| H 0 H_0H0(无演化) | 89.4 | 86.9 | 39.7 | 1.56 |
| 无正则化演化 | 92.8 | 88.9 | 40.3 | 3.80 |
| w/o proposal regularizers | 90.7 | 88.8 | 41.9 | 2.69 |
| w/o acceptance regularizers | 91.5 | 88.7 | 41.0 | 3.59 |
| RRSI | 90.5 | 89.2 | 43.6 | 2.42 |
这组消融清楚展示了过拟合与正则化的权衡。无正则化演化在 evolve split 上达到 92.8,是所有 arm 中最高;但其 OOD Avg. 只有 40.3,距离未演化 harness 的 39.7 只差不到 1 分,而 token 成本从 1.56 million 升至 3.80 million。换句话说,无正则化演化把大量预算用于提高 evolve-set 分数,但迁移收益几乎消失。
去掉 acceptance constraints 后,evolve-set 分数从 RRSI 的 90.5 升至 91.5,但 OOD 平均从 43.6 降至 41.0,token 成本约增加一半(2.42 → 3.59 million/trial)。这符合论文的解释:无约束选择规则把大多数被接受的编辑花在 noise 和 context 上,而不是 mechanism 上。去掉 proposal constraints 后,evolve split 只损失 0.2 分(RRSI 90.5 → 90.7,实际略升),但 OOD 损失 1.7 分(43.6 → 41.9)。这说明即使没有拒绝候选,引导搜索“看哪里”也很重要:proposal-side 约束让搜索更系统地探索组件,而不是把预算耗在已有路径上的局部拟合。
RRSI 在 ID Held-out 上最高,为 89.2,同时 OOD Avg. 最高,为 43.6,token 成本却低于无正则化演化。两组正则化的作用可以理解为互补:proposal-side 约束改善搜索方向与结构探索,acceptance-side 约束阻止噪声、上下文拟合与昂贵但不可迁移的变化进入持久演化路径。
4.4 效率与机制分析 / Efficiency and Mechanism Analysis
RRSI 的两个正则化直接作用于成本。第一,L 1 L_1L1-style budget 拒绝“提议时未被支付”的增长;第二,pruning rule 移除“之后不再被支付”的增长。论文指出,没有 prior method 同时携带这两个约束。下图在 agentic workspace instance 的 evolve split 上测量每个 arm 最终 harness 成本;OOD Avg. 是 JobBench、GDPval、APEX-Agents 平均。图 (a) 中阴影区域是 RRSI 支配的区域:每 trial 更多 policy tokens 换更低 OOD 平均。所有四个基线都落在 RRSI 支配区域:它们花更多 policy tokens/trial,OOD 平均更低。AHE 是极端例子:3.82 million tokens/trial,比 RRSI 多 58%,OOD 低 4.4 分。图 (b) 显示轨迹长度:RRSI 为 26.3 steps/trial,prior methods 为 27.3 到 34.6。没有 evolved harness 像H 0 H_0H0一样便宜:H 0 H_0H0为 1.56 million tokens、21.2 steps。因此,演化确实用 test-time compute 买来部分收益,预算决定买多少。
定性案例进一步说明 RRSI 不是简单累积提高 evolve-set score 的 edits,而是选择性保留 measured benefit 相对 complexity 足够稳健的变化。
| Domain / Round | Harness change | Outcome | What it illustrates |
|---|---|---|---|
| Coding, R0-A | 增加 bounded pre-completion verification audit 和 non-blocking polling of long-running jobs 的 guidance | Accepted:evolve set 上 +3.93 points | 当增益超过 noise threshold 时,可复用 behavioral mechanism 可以正当化相对广泛的 early-round update |
| Coding, R0-B | 增加类似 verification reminder 和 long-running-work guidance,但 measured gain 更小且额外推理成本 | Rejected by cost rule:+1.69 points,+26.1% cost | 当 apparent improvement 落在 noise band 内并需要大量额外计算时,不会自动保留 |
| Coding, R8-B | 将原始 task instruction 固定进 completion gate,使 policy 在提交前重新检查 literal specification | Rejected by floor:-2.81 points,尽管 -13.6% cost | 仅降低 cost 不能补偿 performance 低于 noise-adjusted acceptance floor 的候选 |
| Engineering, R2 | 为反复出现的 “workdir must be an existing directory” tool-use error 增加 bounded recovery hint | Accepted:122/244 → 128/244 passes,+1.6% tokens | 搜索可保留小的、task-agnostic control-flow fixes,以很少复杂度提升可靠性 |
第一轮 coding 的两个候选表面相似,但只有 measured improvement 足够大的候选通过 cost-aware selection rule。第 8 轮 coding 候选降低 inference cost,但 performance 低于 admissible floor,仍被拒绝。Engineering 例子展示互补情况:小的可复用 control-flow correction 在很少资源增长下被保留。这些案例共同表明,stability floor、cost rule、noise-shaped admissibility 与 pruning 共同塑造了演化路径。
五、相关工作 / Related Work
在 agent harness 方向,论文指出 harness 不只是 backbone 决定 agent 能完成什么。前沿实验室工程报告描述 prompt structure、tool interfaces、context compaction、recovery logic 决定长运行 agent 是否能完成任务。近期分析认为 harness 自身可以组合和泛化,好的 harness 甚至可以替代规模,以一小部分成本恢复更大 backbone 的许多能力。然而,这种工程大多是手工的;由于最佳 harness 与特定 backbone 绑定,每次模型发布都要重付成本。
在 harness evolution 方向,最接近的工作自动化该循环:LLM proposer 重写 harness,若编辑提高 benchmark 分数则保留,或只演化单个组件,如 skills、memory,或对 rollouts 的 preference signal。这类方法继承自改进 agent 的机制与风险:在自身代码上搜索,并以经验 fitness signal 驱动。问题在于,搜索由其所优化 suite 的分数驱动,没有泛化项;报告增益经常不能跨 suite 存活;delta attribution 可区分“安装可复用机制”的编辑与“仅拟合 evolution tasks”的编辑。并发工作也直接针对泛化:把泛化作为搜索显式目标,或把 greedy selection 替换为对候选 harnesses 的多样性保留 archive。
RRSI 的贡献与这些方法“编辑什么”正交:它保持相同开放编辑空间,但正则化搜索动态。具体而言,credit 分配给完整演化历史;task-specific logic 在评分前过滤;接受对比噪声调整基线;proposal 通过退火预算、未探索组件引导与结构剪枝目标被塑造。因此,RRSI 的目标是让存活的是机制,而不是对 evolution suite 的拟合。
四个 harness-evolution 基线包括:Meta-Harness,将 harness engineering 表述为对可执行 harness code 的 outer-loop optimization,agentic proposer 可访问 source code、evaluation scores、previous candidates 的 execution traces;Agentic Harness Engineering (AHE),使用 observability-driven evolution loop 演化 coding-agent harnesses,将 harness components、execution experience、edit outcomes 组织为显式表示;Test-Time Harness Evolution (TTHE),在 test-time adaptation 中演化可执行 harness,同时保持底层 model weights 固定,维护多个候选 harnesses,从 execution traces 提出修改,用 agentic judge 选择持续到后续输入的 harness;HarnessX,将 agent harness 表示为 modular、typed primitives 的组合,涵盖 prompts、tools、memory、control flow,其 trace-driven adaptation 机制利用 execution feedback 修改和选择 harness 配置。RRSI 与它们的关键差异在于对搜索动态施加正则化,而不仅是改变编辑空间或选择启发式。
六、局限性与展望 / Limitations & Future Work
论文列出三点局限。第一,研究聚焦 frozen backbone models 的 harness-level RSI,因此不涉及演化过程中更新模型权重的设定。第二,RRSI 仍依赖有限 evolve set 和若干正则化超参数,效果可能依赖反馈信号质量和所选搜索预算。第三,虽然跨多个领域、benchmark、policy models 评估迁移,仍需更广泛验证,以确定方法如何泛化到显著不同的 agent 架构、工具生态与更长运行的自我改进过程。
从给定源码笔记还可确认若干边界。超参数按 evolution instance 固定,且只在 evolve environment 上调参,未使用 held-out 或 OOD;这意味着其泛化性依赖该调参协议。噪声容差δ \deltaδ需要对未改动 base harness 进行重复评估来校准。领域防护是手工设定的:engineering design 使用 0.03 valid-output rate 下降和 0.02 no-submission rate 上升阈值;coding 与 agentic workspace 没有额外 guard。OOD 增益最高 +4.7 分,小于 evolve split 上 +14.1 分,说明泛化差距虽被缓解但仍存在。定性案例是代表性示例,不是统计显著性检验。另外,笔记片段未展示 Eq. (tokenbudget) 的具体形式,因此完整成本接受规则无法仅凭该片段复核;这属于资料限制说明,而不是对论文结论的否定。
展望方面,论文的方向是继续研究 agent-system 层面的递归自我改进,并把正则化原则扩展到更广泛的 agent 架构、工具生态和更长运行过程。一个自然问题是:当 backbone 权重也可更新时,harness-level 正则化如何与模型权重训练交互。另一个问题是:如何减少对有限 evolve set 和手工领域防护的依赖,让正则化从反馈质量、任务分布与搜索预算中自适应校准。
七、总结 / Conclusion
论文研究迭代 harness evolution 作为 agent-system 层面的一种实用 RSI 形式,并表明递归过程本身需要正则化。因为有限 evolve set 在多轮中被自适应复用,表观自我改进可能反映 benchmark-specific fitting、evaluation noise、不必要的复杂度,而不是可迁移进展。RRSI 通过同时正则化 proposal 和 selection,同时保持 harness 编辑空间开放,来应对这一问题。Proposer 侧使用时间退火编辑预算、未探索组件引导与结构剪枝目标;Selector 侧使用稳定性下限、复杂度感知接受规则、噪声带内接受规则与领域特定非补偿性防护。
跨 coding、agentic workspace、engineering design 任务,得到的 harness 提高 held-out 和 cross-benchmark 性能,并比无正则化演化使用更少推理成本。摘要与笔记中的关键数值包括:evolve split 最多 +14.1,五个 OOD benchmark 最多 +4.7,最终 harness 比无正则化演化少用 30% policy tokens;在 agentic workspace 消融中,RRSI 的 OOD Avg. 为 43.6,高于无正则化演化的 40.3 和未演化 harness 的 39.7,同时 token 成本为 2.42 million/trial,低于无正则化演化的 3.80。论文的结论是:通过 RSI 让 agent 系统越来越有能力,不仅要控制“什么可以改变”,还要控制“重复反馈如何转化为持久变化”。
原文摘要:An LLM agent’s capability is largely magnified by its harness, namely the prompts, control flow, tooling, memory, and context management surrounding the frozen backbone model. Recent methods increasingly automate this process by iteratively proposing and selecting component-wise edits of an agent harness, practically establishing a form of recursive self-improvement (RSI) at the agent-system level. However, such recursive evolution may overfit by memorizing the training tasks, showing large in-distribution gains that shrink or even vanish on out-of-distribution benchmarks. We introduce Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), which incorporates the principles of regularizations into harness self-improvement by constraining the evolution candidate proposal and selection. The proposer operates with a temporally annealed budget, limiting how many edits a candidate can bundle, and it encourages unexplored trajectories based on evolution history. The selector is equipped with a critic and a pruner: the critic screens benchmark-specific proposals, while the pruner, removes changes that are too small, too expensive, or no longer useful. Together these constraints favor reusable agent mechanisms over benchmark-specific ones or even noises. Across eight benchmarks spanning coding, agentic workspace and engineering design tasks, RRSI gains up to 14.1 points on the split it evolves against and up to 4.7 points on the five out-of-distribution benchmarks, while producing a harness that runs on 30% fewer policy tokens than the unregularized evolution. Code is available at https://github.com/google-research/rrsi and project page is https://regularized-rsi.com/.
PDF链接:https://arxiv.org/pdf/2609.24972v2