拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

不改模型,分数从43%涨到93%

不改模型,分数从43%涨到93% 同一个模型换四个壳训练收益差37倍。于是问题变成既然车架这么关键它由谁来改、怎么持续变好车架不是一件东西是三件工程车架不是一个提示词模板它至少是三件彼此独立的工程。一、意图管理。长程任务最隐蔽的失败不是“记不住”是“记错了同类”用错了就是错误答案。STITCHACL 2026给每步操作加上三个标签当前目标、动作类型、关键实体。效果随轨迹变长而放大137k tokens 时 11.6%408k时35.6%而去掉“目标”这一个标签长轨迹从 0.592掉到0.213跌了64%。二、记忆管理。MemRL把记忆记成“意图—经验—效用”三组按环境的真实反馈更新每条记忆的效用值全程不改一个模型权重。平均成功率0.798ALFWorld上达到了0.981Q值与真实成功率相关系数0.861。三轨迹优化。AHE把几百万Token的原始轨迹蒸馏成可分层下钻的证据语料让进化智能体把轨迹当文件夹来翻定位根因后只改对应模块。意图、记忆、轨迹三件事情合起来才构成一条完整的进化路径。RSI的两个层次RSI递归自我迭代可以分为两层第一层从产出物学习。跑完一轮拿结果优化下一轮的提示词、工具配置、工作流。像做完题对答案。第二层从机制本身学习。不是改产出是改“怎么产出”的方式——调结构、调策略、调记忆的组织方式。像一个人从“做完事回头看”长成“建立一套认知体系持续调整自己的思维方式”。两条路一个改壳一个改芯第一条路模型不动只改壳DarwinX把模型完全冻结进化压力全放在脚手架上用群体自然选择让变异在任务上竞争。关键机制叫“保留并扩展契约”一个变异想活下来必须新解决原来搞不定的任务同时不能把原来能搞定的搞砸。WebArena上从43.5%上升到93.0%。因为模型冻结所有增益100%可归因于Harness脚手架。第二条路壳不动改芯EvoHarness-RL反着来脚手架结构不变训练模型学会更好地使用这个壳读环境、写进度、翻记忆、记教训四件事共享。于是出现了一个现象他们叫“退火”训练刚开始每步都频繁调脚手架随着训练推进调用频率快速下降最后稳定在大约每回合1次。不是不用了是学会了按需用。跟学开车一个道理起初每个动作都要默念口诀三年后全内化了不默念但该做的都做了。效果就是同一个模型在ALFWorld上从47.9%提高至96.9%。“退火”揭示了一个深层规律有效的外部辅助最终会被内化。合流让一个智能体决定走哪条路两条路各走各的直到SIA把它们拧到一起。三个智能体一个生成脚手架一个拿它跑任务第三个读上一轮的轨迹与失败模式判断这一轮该改脚手架还是改模型权重。当失败源于结构问题解析逻辑不对、重试策略太蠢、工具分发混乱就改壳当失败源于模型缺领域直觉怎么改提示词都教不会的东西就改权重。在三个领域一起进行测试得到了以下结果法律指控分类191 类罪名预测提升25%GPU kernel 优化TritonH100快了12.4%单细胞RNA去噪mse_norm增加20.4%。脚手架更新教会了模型怎么搜索、怎么行动权重更新建立领域直觉是那种任何提示词都给不了的东西。两者不互相替代形成了互补。天云数据在这条路上的位置天云数据采取两条腿走路的方式安心走的是改芯。把现场经验通过强化学习内化成模型直觉例如消防安全大模型的隐患识别准确率达到了97.56%帮手走的是改壳。持续优化意图、记忆与轨迹的脚手架。两条腿联合实现进化Harness脚手架发现的经验内化进模型模型变强后又能驾驭更强的脚手架。所以需要把脚手架当成独立的工程对象来建设与评估有版本号、有回归测试、有可回滚的基线而不是挂在模型身上的一组提示词。这不是说模型不重要恰恰相反只有两边各自变强、又说清每一分提升是谁的功劳这条路才走得下去。DarwinX是外进化壳自己变强EvoHarness-RL是内化模型把壳的用法吃进去SIA是合流壳和芯一起变还多了个“该走哪边”的判断者。外化内化再外化再内化。每一轮循环壳和芯都变强一点。边界不是消失了是变成了一条双向高速公路。发动机和车架一起进化才能跑赢比赛。AI也一样。
返回列表