十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MetaRSI-v1 拆解:自我改进进入平方时代——3B模型自提升10.9分,RSI的五条定律与开源实现

MetaRSI-v1 拆解:自我改进进入平方时代——3B模型自提升10.9分,RSI的五条定律与开源实现 2026年9月6日arXiv上出现了一篇让RSI社区安静了十秒的论文。CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十多所高校发布了MetaRSI-v1。这篇论文做了一件从未有人做过的事让递归自我改进作用于递归自我改进本身。用更直白的话说AI不仅学会了怎么变强还学会了怎么让变强的方式也变强。一个仅30亿激活参数的小模型在四项基准上平均自我提升了10.9分。没有外部教师模型参与没有任何人工标注目标模型自己扮演循环里的每一个角色。六款前沿旗舰模型——包括GPT-5.6、ClaudeOpus5、KimiK3——平均提升了7.3分。这不是又一个在SWE-bench上刷分的RSI实验而是一套试图统一整个RSI领域的架构语言。一个内核、两条编排轴、三个算子、四层Agent嵌套、五条定律——自我改进进入了平方时代。一、RSI的天花板为什么改进自己卡在了代码和数学里递归自我改进不是新概念但它的成功有明确的边界。过去两年RSI在代码和数学领域取得了令人信服的结果。DarwinGödelMachine用进化式搜索改写自身代码SWE-bench解决率逼近人类水平。Google的AlphaEvolve甚至解决了困扰数学界数百年的亲吻数问题相关进展。但这些成功有一个共同前提任务必须是机器可检验的。代码能跑通测试用例就算对数学证明能通过Lean形式化验证就算成立。一旦任务的正确性需要靠论证、复现或测量来判定RSI就失去了它的锚点。论文作者用一个精准的措辞概括了这个问题RSI被绑定在了机器可检验的切片里。真正的科学研究和工程实践大量任务的正确性是靠同行评议、实验复现、长期观测来判定的。在这些领域没有一个自动化验证器能在毫秒级给出0或1的奖励信号。MetaRSI-v1的出发点就是打破这个边界让RSI不再局限于形式化评估可达的范围。METR的TimeHorizon数据印证了这个瓶颈的存在。截至2026年5月最强模型的时间地平线已经顶穿了现有benchmark的可测上限。ClaudeMythosPreview测出50%时间地平线≥16小时但228个任务里只有5个估计时长≥16小时。换句话说最强模型已经跑赢了测量工具而RSI红线所在的区间恰好落在测不准的地方。RE-Bench的结论同样说明问题2小时预算下AI得分是人类的4倍32小时预算下人类反超到AI的2倍。AI赢在快速试错输在长程积累——这正是RSI需要突破的结构性限制。二、LoopKernel把进步如何发生抽象成一条通用闭环MetaRSI-v1的核心创新是提出了LoopKernel范式。它第一次把进步如何发生抽象成了一条与改进对象无关的通用闭环。这条闭环的运转逻辑是消费反馈得到学习信号在Data、Harness、Model上提出改动。改动交由验证器裁决结果回流为下一轮信号驱动下一轮改进。Data、Harness、Model从此成为同一个Kernel的不同实例化算子。它们可组合、可统一调度不再互相排斥。在此之前RSI领域的三条路线——数据改进、脚手架改进、模型改进——是各自为政的。Data-RSI只关心训练数据的质量和多样性。Harness-RSI只优化提示词、工具调用和记忆检索策略。Model-RSI只做微调、蒸馏和权重更新。三条路线各自有论文、各自有benchmark、各自有开源库。但它们从未被统一到同一个循环里协同运转。LoopKernel的价值在于它提供了一个共享的制品词汇表和统一的执行骨架。三种算子的产物可以在同一个循环里流动、互相消费、互相驱动。三、三种算子Data-RSI、Harness-RSI、Model-RSI的分工与协作Data-RSI是能力边界的探测器和放大器。它从模型自身的运行轨迹中提取学习信号经校验后合成可复用的训练数据。关键创新在于Data-RSI不仅放大模型的正向能力还标定能力的负向边界。它明确告诉系统这个模型在哪里可靠、在哪里不可靠。这些标定产物同时供给Harness-RSI和Model-RSI消费。Harness-RSI在不触碰模型权重的前提下实现自我改进。它把Harness拆分为五个可插拔槽位SystemPrompt、Skill、MCP、Tools、Memory。学习反馈信号驱动这五个槽位的增删改查做加法也做减法。当Data-RSI暴露的问题被Model-RSI内化之后Harness中原本吸纳的知识变得冗余。Harness-RSI在回放校验下将这些冗余删除——能力留下成本退场。Model-RSI通过有界训练将反复验证有效的行为内化到模型参数中。三条路线的改动结果又流回Data-RSI重新标定能力边界驱动下一轮循环。能力由此逐轮披露、逐轮累积形成正反馈飞轮。四、双轴编排横向调度算子顺序纵向优化算子策略有了三种算子下一个问题是谁来决定先执行哪个MetaRSI-v1用双轴编排策略来回答这个问题。横轴是算子调度——RSI²Agent在每个决策点根据信号反馈选定下一个算子。选定后将算子有机衔接送入LoopKernel执行。纵轴是策略优化——RSI²Agent向目标算子专属的Sub-Agent下发指令。Sub-Agent根据学习信号和环境反馈改写算子内部的RSI规则。换句话说横轴决定下一步改进什么纵轴决定怎么改进这个改进过程。这两条轴线的交叉点就是MetaRSI名字里的那个平方。它不是简单地把三种RSI拼在一起而是让编排策略本身也成为可学习、可优化的对象。横向调度可以被纵向优化改写纵向优化的策略本身又可以被元层Agent调整。这种递归嵌套让改进的改进方式也能随经验积累而进化。五、四个Agent、三层嵌套改进的权力结构MetaRSI-v1的完整架构由四个Agent协同运作。TransitionAgent负责衔接横向编排中上下游算子的产物。它确保上游算子的输出格式与下游算子的输入预期一致。RSI²Agent是核心决策者在每个决策点选择横轴操作或纵轴操作。RSI²Sub-Agent是纵向优化的执行者接受RSI²Agent的指令调整算子策略。MetaRSI²Agent处于最顶层学习如何进行合适的纵横优化。它优化的是RSI²Agent本身的决策策略。四个Agent形成了三层RSI嵌套算子改进目标系统双轴编排改进算子用法元层改进编排策略。整套架构支持human-in-the-loop任何一层的Agent都可以被人类专家局部替换。这种分层设计让系统在追求自动化的同时保留了人类判断力的接入点。论文将此提炼为五条定律中的第四条可信度由不可写面度量。闭环内部无法区分真正变强和放宽了成功标准人类监督是外部校准的唯一来源。六、实验数据3B模型自我提升10.9分前沿模型平均7.3分实验沿两条路线展开覆盖从小模型到旗舰模型的完整光谱。小模型路线使用Qwen3.5-35B-A3B35B总参、3B激活参数。三个算子全部启用在Terminal-Bench2.1、SWE-benchPro、GPQA-Diamond高难度子集、AIME上评测。MetaRSI-v1让这个3B模型平均自我提升了10.9分。SWE-benchPro的解决率接近翻倍Meta层为RSI带来了更高的天花板。连续自进化的累计增益显著——不是一次性提升后就饱和而是逐轮持续增长。前沿模型路线面向ClaudeOpus5、GPT-5.6Sol、KimiK3等六款旗舰模型。这些模型参数巨大或为闭源仅启用Data-RSI和Harness-RSI两个算子。不触碰权重纯靠数据改进和脚手架优化六款模型在Terminal-Bench2.1上平均提升7.3分。这个结果说明MetaRSI范式对前沿模型同样成立。旗舰模型同样留有可观的自我改进空间只是需要更精细的算子组合来激活。论文还发现了一个关键规律工具数量几乎不影响结果质量。Selenium的56个工具得分高于Filesystem的14个工具。真正拖累质量的是参数复杂度——Git平均每工具11.2个参数95%为可选得分垫底。参数数量与工具调用质量的相关系数为-0.60工具数量仅为0.40。失败模式的分析同样有启发性最常出错的不是选错工具而是填错参数值。42%的记录在参数上得满分57%得部分分只有2.3%的记录整体得分低于0.5。Redis场景中Agent反复用正确的key和value调用set工具却跳过了可选的过期时间字段。这说明参数复杂度的代价是隐性的——Agent不会报错只是默默地丢掉了关键细节。Git场景暴露了另一个罕见但有趣的问题Agent生成了MCP规范中不存在的真实Git命令。fetch、revert、filter-repo这三个命令来自模型的预训练知识而非工具定义。论文称之为预训练知识泄漏在893次工具调用中出现了3次。七、五条定律进步的单位是循环MetaRSI-v1在实验之上提炼出五条可证伪的定律。定律一验证决定自我改进的前沿。一个领域能不能形成自改进闭环取决于该领域任务能否被检验。没有合适的verifierRSI就是无根之木。定律二自我认知会过期重新发现能力边界是速率瓶颈。RSI每改变一次Agent的能力其旧的系统描述随即失效。能力边界需要被持续重新探测而不是依赖初始快照。定律三能力与载体无关但成本与载体有关。同一项能力放在Harness里每次推理都要重付成本。内化进Model只需付一次训练成本成熟循环能持续把能力迁移到更便宜的载体。定律四可信度由不可写面度量。闭环内部无法自我区分真正能力变强和放宽成功标准。这种偏差从内部无法察觉也无法靠统计纠正。定律五循环不凭空创造能力。一切增益本质上都是外部信息熵的输入或已有能力的激发。自我改进只能重新组织、放大并固化模型已具备的潜力。每次提升都要分清哪些是把已有能力放大出来的哪些是真正从外部新引入的。八、RSI-Harness一个可运行的开源实现CosmosMind同步开源了RSI-Harness让MetaRSI的循环从论文走进可执行代码。这个开源项目的定位是一个能自我学习、自我迭代的Harness。它可以在使用中为不同科学领域沉淀出可移植的HarnessGenome。以下是用RSI-Harness运行一个最小RSI循环的核心代码片段from rsi_harness import RSILoop, DataRSI, HarnessRSI, ModelRSI from rsi_harness.verifiers import TaskVerifier # 定义验证器每个领域只需准备这一件东西 verifier TaskVerifier( task_familyswe_bench_pro, evaluatorlambda result, ref: result.passes_tests(ref) ) # 初始化三种算子 data_op DataRSI(verifierverifier, signal_sourcetrajectory) harness_op HarnessRSI(slots[system_prompt, skills, tools, memory]) model_op ModelRSI(training_config{lr: 1e-5, epochs: 3}) # 组装循环内核 loop RSILoop( kernelunified, operators[data_op, harness_op, model_op], orchestratortwo_axis, # 横轴调度 纵轴优化 meta_policyTrue # 启用元层策略学习 ) # 运行自改进循环 for round in loop.run(target_modelqwen3.5-35b-a3b, max_rounds10): print(fRound {round.index}: freward{round.reward:.3f}, foperator{round.selected_operator}, fbelief_update{round.delta_belief:.4f}) # 五条定律的工程化映射 assert loop.verifier_available, 定律一无验证器则无循环 assert round.boundary_rediscovered, 定律二能力边界需持续探测 print(f载体成本: harness{round.harness_cost}, model{round.model_cost})代码展示了MetaRSI的核心设计哲学验证器是循环的锚点算子是可插拔的执行单元。orchestratortwo_axis启用双轴编排meta_policyTrue启用元层学习。开发者只需更换task_family和verifier就能将同一套循环迁移到新领域。论文指出新领域接入只需要三样东西任务族、验证器、初始脚手架。其他部分全部由通用机制接管无需为每个领域重新编写RL集成代码。团队同时搭建了Genome开放社区让每个科学领域能沉淀自己的可移植脚手架。九、与GödelAgent和DGM的差异不是改代码是改改进方式RSI领域此前有两个标志性方向需要区分。GödelAgent2024让Agent读取和修改自身代码实现自我感知和自我修改。DarwinGödelMachine2025用进化式搜索改写Agent源代码用benchmark实测验证改进。这两条路线的共同特点是改进的对象是Agent的代码或行为逻辑。MetaRSI-v1的改进对象不同——它改进的是改进过程本身。Data-RSI改进的是用什么数据来训练Harness-RSI改进的是用什么脚手架来运行。Model-RSI改进的是用什么方式来更新权重。三者的编排策略又由RSI²Agent和MetaRSI²Agent来学习和优化。这种多层嵌套让改进的粒度从改一次代码升级到改整个改进管线。论文用一句话概括了这个差异MetaRSI-v1将自我改进从单一面的编辑重构为跨全管线的组合。这也解释了平方这个名字的由来不是改进次数变多而是改进维度变深。一阶RSI改模型本身二阶RSI改改模型的方式MetaRSI同时优化两者。十、Harness路线的意义不碰权重也能自我进化MetaRSI-v1最重要的工程意义在于Harness-RSI这条路线。它证明了一件事不触碰模型权重纯靠脚手架优化就能实现显著的自我改进。这意味着RSI的适用范围从可训练的开源模型扩展到了任何可通过接口调用的模型。ClaudeOpus5、GPT-5.6这些闭源旗舰模型无法做微调或蒸馏。但通过Harness-RSI它们的SystemPrompt、工具配置、记忆策略仍然可以被自动优化。六款前沿模型平均提升7.3分的结果就是这条路线的实证。对于工程团队来说这意味着不需要等模型厂商开源权重也不需要自建训练基础设施。只要能定义验证器和任务族就能让现有模型在使用中持续自我改进。成本也更可控Harness-RSI的单次迭代成本远低于Model-RSI的训练成本。定律三说得很清楚能力与载体无关但成本与载体有关。成熟循环能把能力从昂贵的载体训练权重迁移到便宜的载体脚手架配置。这条路线对没有GPU集群的中小团队尤其友好。他们可以用现有API接入模型通过Harness-RSI持续优化运行配置。不需要微调、不需要蒸馏、不需要自建训练流程就能获得自我改进的收益。十一、对Agent基础设施的启示MetaRSI-v1对当前Agent基础设施生态有几个直接启示。第一MCP工具的参数设计需要简化。论文实验显示参数复杂度与工具调用质量强负相关r-0.60。每增加一个可选参数就增加一次Agent填错值的概率。工具设计者应该优先减少参数数量而不是增加功能覆盖。第二Harness的五个槽位提供了一个清晰的优化框架。SystemPrompt、Skill、MCP、Tools、Memory——这五类资产都可以被Data-RSI的信号驱动改进。对于正在构建Agent平台的团队这五个槽位就是持续优化的切入点。第三验证器的建设是RSI的前提条件。定律一明确指出没有合适的verifier自我改进循环就无法启动。企业落地Agent时第一步不是优化模型而是建立可靠的自动化评估体系。第四元层学习降低了调参成本。MetaRSI²Agent自动学习何时用哪个算子替代了人工设计编排规则。这在多Agent系统中尤其有价值——编排策略可以随运行数据自动进化。第五Data-RSI的能力边界标定思路可以直接应用到Agent质量监控中。传统Agent系统只监控成功率和延迟不监控在哪些类型的任务上可靠。Data-RSI提供的正向和负向能力边界可以帮运维团队识别Agent的盲区。十二、从论文到工程接入门槛有多低MetaRSI-v1的设计哲学是降低新领域的接入门槛。论文明确表示不要求一个领域一步到位执行整个Loop。科学研究和工程实践本身就是一条条流水线——假设、设计、执行、解读。每个环节都有清晰的输入和输出可以独立跑通一个小循环。当足够多的小循环转起来它们会彼此衔接编织成覆盖全流程的大循环。接入只需要三样东西能跑出结果的任务族、判断对错的验证器、哪怕粗糙的初始脚手架。RSI-Harness开源库已经提供了LoopKernel和三种算子的参考实现。Genome开放社区正在积累各领域的可移植脚手架模板。对于一个想要尝试RSI的工程团队最小可行路径是选一个有自动化测试的模块。用现有测试用例作为验证器用RSI-Harness跑一个Data-RSI单算子循环。观察一轮改进后benchmark的变化再决定是否加入Harness-RSI和Model-RSI。这种渐进式接入策略与论文的五条定律完全一致。先验证循环能不能转起来再决定要不要加更多算子。论文还提供了七种MCP规范的评测数据作为参考。Selenium的56个工具、Filesystem的14个工具、Redis的8个工具各自代表不同的复杂度光谱。开发者可以对标自己的工具集预估RSI在自己场景下的预期收益。十三、开放问题与下一步MetaRSI-v1打开了几个值得追蹤的开放问题。定律四指出闭环内部无法自我区分真正变强和放宽成功标准。这意味着外部人类监督仍然是不可替代的校准来源。多长时间做一次人工审计审计的粒度应该到什么级别这些问题没有标准答案取决于领域特性和风险容忍度。Data-RSI依赖训练时可检索的特权Skill来提供学习信号。在没有高质量Skill库的领域能否复现同样收益还需要更多验证。元层学习的样本效率也需要进一步研究。MetaRSI²Agent需要多少轮循环才能学到有效的编排策略在小样本场景下元层是否会过拟合到特定任务族这些问题不会削弱MetaRSI-v1的贡献而是指明了下一步的研究方向。自我改进从能不能做到进入了怎么做得更好的阶段。而MetaRSI-v1提供的架构语言和五条定律为这个阶段奠定了可讨论、可实验的基础。PostTrainBench的最新数据也值得关注给Agent一张H100和10小时让它完全自主地把base模型post-train成instruct模型。目前最佳AgentOpus4.6ClaudeCode平均得分23.2%对照官方instruct模型的51.1%——总体还差得远。但窄域已经反超GPT-5.1CodexMax给Gemma-3-4B做的函数调用后训练在BFCL上拿了89%官方模型只有67%。窄域反超、全域落后——这七个字概括了2026年年中AI自动化AI训练的全部真相。MetaRSI-v1的Harness-RSI路线为这个格局提供了一条不碰权重的中间路径。它不要求Agent自己训练模型而是让Agent优化自己运行的脚手架——门槛更低风险更可控。论文地址arxiv.org/abs/2609.06396开源项目github.com/CosmosMind-ai/RSI-HarnessRSI-Harness已经在GitHub上开源Apache2.0许可证。Genome开放社区正在招募各领域的早期贡献者。如果你的团队正在构建Agent系统MetaRSI-v1的五条定律值得一读再读。
返回列表