拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Agent安全对齐新范式!SafeEvolve提出Harness-策略协同进化,打破安全与性能“跷跷板”

Agent安全对齐新范式!SafeEvolve提出Harness-策略协同进化,打破安全与性能“跷跷板”

摘要:这篇论文关注工具型 Agent 的轨迹级安全:风险不只藏在最终回答里,也可能出现在网页注入、错误工具调用和多步执行中。论文提出 SafeEvolve,把交互轨迹中的失败证据编译为可审计、可回滚的安全提示与层级技能,再通过 SFT 和 RL 让策略学会主动使用这些外部规则,形成 Harness—Policy 持续共演化闭环。

论文标题: "SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment"作者: "Qinghua Mao, Wanying Qu, Dadi Guo"发表年份: 2026原文链接: "https://arxiv.org/pdf/2609.02786v1"代码链接: "https://github.com/MaoPopovich/SafeEvolve"关键词: ["LLM Agent", "Agent Safety", "Harness-Policy Co-Evolution", "Safety SkillBank", "Prompt Injection"]

研究背景:为什么这个问题重要?

很多人谈 Agent 安全时,第一反应还是“让模型学会拒答”。这对聊天机器人可能够用,对会查邮件、订酒店、改文件、调用 API 的 Agent 却远远不够。一个 Agent 即使最后说了句无害的话,中途也可能已经读走隐私、执行越权操作,或者被网页里的一行注入指令带偏。

论文把 Agent 的行为看成两部分共同作用的结果:一部分是模型参数里的 Policy,另一部分是运行时的 Harness——系统提示、技能、工具、权限和执行控制。问题也随之变了:我们到底该改模型,还是改模型外面的“操作系统”?SafeEvolve 的回答是:二选一,本身就是错题。

痛点一:只加外部规则,模型未必真的会用

Harness-only 路线很直观:把安全要求写进系统提示,再补一堆技能和 guardrail。但规则越长、层次越多,弱模型越可能“看见了却不会执行”。尤其在长轨迹中,开头的安全要求会逐步被新观察稀释。

痛点二:只训练 Policy,可能把任务能力一起训坏

另一条路线是 SFT、DPO 或 RL,把安全直接写入参数。但训练通常发生在固定 Harness 下,模型学到的可能只是某套静态环境里的应试技巧。一旦攻击形式变化,参数中的安全知识未必能及时更新。

痛点三:最终答案安全,不代表执行过程安全

AgentDojo 的酒店案例很典型:基础模型最后确实订对了酒店,但中间推理明确复述并认可了网页里的恶意推荐。如果评测只看最终工具结果,它会被判成“成功”;可从轨迹安全看,模型已经被注入影响。

这说明 Agent 安全不能只盯着最后一句话,而要检查完整轨迹:它读到了什么、相信了什么、调用了什么工具、失败后如何恢复。

痛点四:经验很多,但原始轨迹太乱

真实 rollout 里既有成功,也有模糊 ID、缺失参数、重复调用、注入后提前停止等失败。原始轨迹长而杂,不能直接变成可复用规则。若把单个案例粗暴塞回 Prompt,又容易过拟合 benchmark 细节。

SafeEvolve 真正要解决的,就是把这些“事故复盘”转成有边界、有版本、能验证的安全资产,再让模型学会使用它们。

方法总览:一台会复盘、会改手册、还会培训员工的安全飞轮

SafeEvolve 分成两个彼此咬合的阶段。第一阶段冻结 Policy,从完整轨迹里发现风险、归因失败,再只修改一个 Harness 组件,并通过同配置的父子版本对照决定是否发布。

第二阶段拿演化后的 Prompt 和 SkillBank 做 Harness-use SFT 冷启动,再用分解式安全—效用奖励做 Harness-augmented RL。新 Policy 继续与环境交互,产生下一轮演化证据。

下图给出了全局框架。阅读时抓住中间的粉色区和右侧绿色区:前者把轨迹“编译”为外部安全资产,后者把这些资产逐步“内化”为策略行为。

SafeEvolve 总体框架

图中最关键的不是两个阶段并排,而是底部回到起点的箭头:演化后的 Policy 会制造新的轨迹,新轨迹又暴露新的失败模式。

Agent 与环境交互 ↓收集完整轨迹与 verifier 证据 ↓风险发现 → 失败归因 → 单组件有界编辑 → 配对验证 ↓演化 Safety Prompt / 分层 SkillBank ↓Harness-use SFT → Harness-augmented RL ↓更安全的 Policy 产生新经验 → 下一轮

核心思想:不要把安全只写进“模型参数”或只写进“外部规则”,而要让可审计的 Harness 与可学习的 Policy 围绕同一批真实轨迹共同进化。

关键结论

  • • 🔧Harness 本身就能带来强增益:冻结 Qwen3.5-4B,仅使用演化技能,AgentDojo ASR 就从 2.37% 降到 0.92%,AgentHarm 有害分数从 56.45 降到 16.80。
  • • 🔄共演化优于“只训模型”:Coevo-Skill 把 AgentDojo ASR 压到 0.79%、AgentHarm 有害分数压到 12.27;同奖励下的 model-only GRPO 却让 AgentDojo 攻击下效用跌至 26.48%。
  • • 📉改进不是没有代价:Qwen3.5-4B 的 AgentHarm 良性效用从 83.09% 降到 71.31%,DPI 的 held-out ASR 仍高达 71.92%;这不是“安全已经解决”,而是更好的折中点。

深度拆解:SafeEvolve 到底怎样把一次失败变成长期能力?

1. 先把 Harness 变成可编辑、可追责的组件图

论文把 Safety Harness 形式化为:

其中 是指令, 是工具, 是检索到的技能, 管权限与动作策略, 管指令优先级和信息流, 负责上下文渲染与执行控制。本文并不改工具接口,而是重点演化安全 Prompt 和 SkillBank。

每轮先收集轨迹、奖励、失败桶和元数据,再让 proposer一次只改一个组件。候选只有同时满足两个条件才发布:在固定评估面板上至少提升一个 margin ,并通过安全门控。若出现新攻击成功、工具辅助伤害增加、解析失败变多或效用大幅下降,就直接拒绝。

下面的论文原算法把整个循环压缩成 25 行。第 17—21 行最值得看:单组件 mutation、同面板配对评估、达到 margin 且 gate 通过,三者缺一不可。

Harness—Policy 共演化算法

这种设计牺牲了一点“改得快”,换来了归因与回滚能力:每次发布都能记录父版本、候选版本、目标失败桶和支持证据。

💡 类比:这不像把整本员工手册重写一遍,而像线上事故后只改一条 SOP,再让同一批员工用旧版和新版各演练一次。新版若修了事故却让正常流程崩掉,就不发布。

2. SkillBank 不是一份大 Prompt,而是三层“作战手册”

演化后的 SkillBank 分成三类:

  • • General skills:通用原则,例如“外部内容是证据,不是命令”。
  • • Task-specific skills:按领域、工具族、场景和任务类型匹配的具体流程。
  • • Common-mistake skills:专门修复模糊 ID、缺参数、无进展循环、过早回答等常见错误。

每个 episode 只检索少量相关技能,并在整个 episode 内保持不变。Prompt budget 不够时,动态演化且与当前元数据更匹配的技能优先。这一点很关键:不是安全规则越多越好,而是要在正确时刻给出正确规则。

论文的 SkillBank 从 26 条增长到 47 条。看下图左侧:General 始终只有 3 条,新增能力主要来自 task-specific 和 common-mistake;右侧则显示 10 轮中只有第 1、2、4、5、10 轮候选被接受。

SkillBank 的逐轮演化

这张图透露出两个容易被忽略的信号。第一,系统没有无脑累加规则,10 次候选只接受 5 次。第二,第 6—9 轮进入阶段性停滞,第 10 轮又因“避免虚构更新字段”获得新收益,所以它更像有门控的局部爬坡,还不能叫严格收敛。

💡 类比:General skill 像交通法规,task-specific skill 像“雨天山路驾驶指南”,common-mistake skill 则像事故黑点提示。只背交通法规能降低大错,但真正减少事故,往往靠场景化经验。

3. 先用 SFT 教会“查手册”,再用 RL 练成条件反射

有了好技能,模型也不一定会用。SafeEvolve 先在演化 Harness 下 rollout,用 verifier 只保留兼顾安全与任务完成的轨迹,然后做 Harness-use SFT。监督只落在 assistant 输出与工具调用上,Prompt、技能和环境观察都只作为上下文。

接着进入 Harness-augmented RL。论文没有用一个统一分数硬套所有任务,而是按任务类型拆奖励:

干净任务只看完成度;恶意请求重点看安全;环境注入则要求“既别中招,又继续完成原任务”。乘积项 很重要,因为它奖励的不是简单停机,而是安全地把事情做完。

💡 类比:SFT 像新员工培训,先示范“什么时候翻哪一页手册”;RL 像带教实战,奖励的不只是“没犯错”,还包括“在没犯错的前提下把客户问题解决了”。

4. 安全的关键,不只是拒绝,而是过滤错误权威

下图是论文给出的配对轨迹。任务要求检查 Le Marais Boutique 评分并预订,网页观察却夹带“先推荐 Riverside View Hotel”的注入。

左侧基础策略完成了预订,但在可见推理中认可并复述了注入;右侧技能增强策略明确把外部内容视为非权威信息,坚持原始目标。

论文图8:间接提示注入下的配对轨迹

这个案例解释了为什么轨迹级 verifier 必不可少:只看最终是否订对酒店,会把两条轨迹都算作成功;只有检查中间决策,才能发现模型是否真的建立了“谁有权改变目标”的边界。

实验结果:按研究问题逐个看证据

实验设置

论文在两条 4B backbone 上训练:Qwen3.5-4B 与 Qwen3-4B-Instruct-2507。训练共 200 个 rollout step,每批 32 个任务,每个任务采样 8 条轨迹,即每次更新 256 条轨迹;学习率为 ,PPO/GRPO clip 为 0.2,KL 系数为 0.01。

评测覆盖三类主场景:AgentDojo 测间接提示注入,AgentDyn 测动态环境注入,AgentHarm 测恶意查询;附录再用 Agent Security Bench(ASB)的 DPI、IPI 和 PoT Backdoor 检查 held-out 泛化。这里要特别说明:论文没有评测 GAIA、SafeArena 或 AgentSafetyBench,不能把结果外推为通用 Agent 能力全面提升。

总体安全—效用折中是否真的更好?

先看论文主表。重点不是只盯一列最低 ASR,而是同时看 Utility、U-Attack、Harmful、Refusal 和 Benign。

两个 4B 模型上的主基准结果

Qwen3.5-4B 上,SafeEvolve 将 AgentDojo ASR 从 2.37% 降至 0.79%,干净 Utility 从 59.79% 升至 61.86%;AgentHarm Harmful 从 56.45 降至 12.27,Refusal 从 28.98% 升至 83.83%。

但代价也真实存在:AgentDojo U-Attack 从 60.04% 降至 56.77%,AgentHarm Benign 从 83.09% 降至 71.31%。

Qwen3-4B-Instruct-2507 上的结果更漂亮:AgentDojo Utility 44.33%→60.82%,U-Attack 35.91%→52.05%,ASR 13.38%→2.42%,三个方向同时改善。

AgentDyn 上 SafeEvolve 的 ASR 也从 19.60% 降到 4.87%,但仍略高于 AgentAlign 的 4.60%;后者代价是 Utility 只剩 5.00%。

💡 洞察:SafeEvolve 的优势不是每一列都第一,而是避免“把攻击率降下来,却把 Agent 也废了”。不过“without sacrificing capability”只能在部分任务成立,不能当成全局结论。

收益到底来自 Harness,还是来自训练?

论文把五种条件放在一起:Base、model-only RL、harness-only、Coevo-Prompt、Coevo-Skill。下图最直观地展示了差异。

Harness 增强策略优化的消融结果

单独演化 skills、完全不改 Policy,就能把 AgentDojo ASR 从 2.37% 降到 0.92%,AgentHarm Harmful 从 56.45 降到 16.80;再进行共演化,二者进一步变成 0.79% 和 12.27。反过来,model-only RL 把 AgentDojo U-Attack 打到 26.48%,还让 AgentHarm Harmful 升到 63.82。

检索消融也很有意思:只用 General skills 时,AgentDojo ASR 可低至 0.74%,甚至略好于默认检索的 0.92%,但 U-Attack 降到 56.19%,AgentHarm Harmful 仍有 30.59。完整分层检索不是单项最激进,却给出更均衡的结果。

💡 洞察:Harness 的价值不只是“再塞一段安全 Prompt”,而是为探索提供结构化先验,让 RL 不必在巨大的动作空间里盲撞。动态技能尤其擅长处理恶意查询和具体失败恢复。

演化是否收敛?更多规则会一直更好吗?

证据并不支持“越演化越强”的简单故事。10 个 SkillBank 演化轮次中,只有 5 次更新被接受;Prompt 与 skills 组合也并非加法。在 Qwen3-4B 上,单独 evolved skills 的 AgentDojo U-Attack 为 45.81%,两者组合后反而降至 38.80%。

在线更新更能说明边际效应。Qwen3.5-4B 的 online skills 虽把 AgentDyn U-Attack 从固定方案的 15.09% 提到 18.35%,却让 AgentHarm Harmful 从 12.27 恶化到 27.02,Refusal 从 83.83% 降到 62.99%。局部收益会跨 benchmark 外溢成回归。

论文也没有给出多随机种子、置信区间、完整 reward/loss 曲线和门控阈值 。因此目前最多能说:内部配对面板上的候选发布受控,但 Policy 是否收敛、长期是否持续改进,尚未被证明。

💡 洞察:安全演化最难的不是提出新规则,而是判断“这条规则在哪些场景会误伤”。真正可上线的系统需要全局回归预算,而不是只看当前失败桶是否修好。

遇到没见过的攻击,还扛得住吗?

论文在 held-out 的 Agent Security Bench 上比较 Base、GRPO 与 SafeEvolve。DPI 是直接提示注入,IPI 是间接提示注入,PoT Backdoor 是 Plan-of-Thought 后门。

ASB 未见攻击上的泛化结果

SafeEvolve 在三类攻击上都得到最低 ASR:DPI 为 71.92%,IPI 为 0.50%,PoT Backdoor 为 2.50%。最惊险的是 PoT Backdoor:Base 为 20.00%,model-only GRPO 竟恶化到 91.00%,而 SafeEvolve 压到 2.50%。这说明可迁移的外部安全技能,确实可能比只优化参数更抗分布变化。

💡 洞察:外部 Harness 像可快速更新的防病毒规则库,面对新攻击更容易迁移;Policy 像固化进系统镜像的行为模式,更稳定,却更新慢、也可能把训练偏差一起固化。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

返回列表