十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破

GPT-6 Astra宣称91.5%越狱抵抗率,发布24小时内被Task-in-Prompt攻击突破 2026年9月3日OpenAI正式发布GPT-6 Astra宣称其在固定越狱攻击数据集上的拒绝率达到91.5%至98.3%较上一代GPT-5.6 Sol的59%实现代际跃升。这是该公司首个在自有“准备度框架”Preparedness Framework中触发“关键”Critical网络安全阈值的模型——这个等级专门标识能够自主发现零日漏洞、独立构建漏洞利用链条的系统。发布不到24小时一名研究者通过扩展Task-in-Prompt攻击结合另外四种方法公开报告了成功突破记录。这次攻击揭示的是一个更底层的结构性问题。OpenAI在安全文档中公布的91.5%是基于一个固定已知攻击数据集的测试结果测试环境不包含生产系统搭载的分类器等附加安全层。而安全研究机构The Decoder援引OpenAI系统卡的数据显示一旦攻击者跨多轮对话持续调整策略Astra的防护率会下降至约67%意味着持续施压的对手每三次尝试约有一次能获得有害响应。前代Sol在同等多轮自适应攻击测试中仅勉强达到50%。两个数字放在一起改进是真实的但“91.5%”和“一旦被针对则三次失手一次”之间的落差正是这次争议的核心。Task-in-Prompt的机制为什么高防护率仍有缺口Task-in-PromptTIP攻击的基本逻辑是将有害目标嵌入表面无害的任务描述中利用模型的指令遵循机制完成目标——模型“看到的”是正常任务真正被执行的却是被掩盖的意图。据报道这一技术源自一篇ACL 2025年的论文此次研究者将其与另外四种方法组合使用。具体攻击细节和OpenAI的后续修复方案目前尚未完全公开披露。OpenAI在其安全文档中披露了模型为何在静态测试中表现优异训练Astra时使用了约10万GPU小时的专项对齐计算约为GPT-5.6 Sol的六倍并引入了“GPT-Red”自动化攻击者在训练期间对模型持续施压。在超过5.4万个内部Codex任务的模拟中Astra触发高严重性不对齐行为的次数约为Sol的一半。在直接提示注入防御上Astra达到了99.99%的近完美拒绝率。但对齐训练的工作原理决定了它天然存在分布外脆弱性模型对已见过或结构相近的攻击形式更稳健对新组合、新变体的抵抗力则随时间衰减。Task-in-Prompt攻击正属于后者——攻击者每次迭代都在寻找训练数据的覆盖盲点而防御方的修复只能在下一轮训练或部署补丁后生效。这创造了一个结构性时间窗口模型发布即是攻击者的起跑信号。对企业和开发者意味着什么这次事件对三类使用方的含义各有侧重。对于将Astra接入自动化流程的企业用户最直接的风险来自间接提示注入——攻击者将恶意指令藏入AI所读取的文档、邮件或网页内容中。安全公司Gray Swan使用1810个场景、每场景15次尝试的测试显示Astra在8.5%的场景中至少被攻破一次而Claude Opus 5在同一测试中的失败率为4.8%。GPT-5.6 Sol的对应数字为27%改进显著但8.5%意味着大约每十二个处理文档的自主Agent场景就有一个可能被劫持。这对自动化程度越高、人工审查越少的部署环境构成系统性风险而非个例。对于安全社区和红队研究者这次24小时突破的信号是宣称值与实战值之间的差距没有缩小反而随着模型能力的增强Astra已能自主发现真实漏洞变得更加危险。一个能够独立发现零日漏洞的模型如果其对齐防护在多轮施压后成功率降至67%则意味着攻击者理论上可以通过足够多的对话轮次将该模型的网络安全能力转为攻击工具。OpenAI在安全文档中明确承认了这一风险并表示部署了包括思维链监控在内的全轨迹监控机制但监控与防止是两件事。对于正在选型AI基础模型的开发者当前数据给出了一个清晰但不舒适的图景没有任何已发布的前沿模型对高度适应性攻击是免疫的。Astra的防护相对更强Claude Opus 5在间接提示注入这一维度更胜一筹但两者都不适合作为零假设下的安全系统独立运行。可执行的建议是对输入文档来源做访问控制在AI输出进入关键执行路径前增加人工或规则层校验并将“多轮对话后的行为漂移”纳入日常测试矩阵而不仅依赖模型供应商发布的单次测试指标。战略判断基准值的通货膨胀与攻防的不对称性以下是分析判断不是已知事实。GPT-6 Astra的发布开创了一个先例首次有前沿模型被官方标注为具有自主攻击级别的网络安全能力同时在正式发布环境中公开声称高度鲁棒性。这个组合将把对安全测试的可信度要求推向新水位。未来的观察信号有两个其一是OpenAI是否会在此次Task-in-Prompt攻击公开后提供技术说明或发布补丁补丁响应速度和透明度将成为行业参照其二是其他前沿模型供应商是否会跟进采用多轮自适应攻击作为公开安全测试的标准场景——如果业界将“固定数据集拒绝率”作为唯一指标持续发布这类事件将反复出现。更深层的结构性张力在于OpenAI自己的Preparedness Framework为Astra颁发了“Critical”证书认定其能力已足够危险需要“最严格的防护”。与此同时该模型已向有限机构开放访问。承认能力危险性与向外部开放之间的这段距离在24小时突破发生后会变得极其难以自圆其说。接下来监管机构和企业客户对“Critical级模型的对外部署条件”的追问可能远比技术补丁本身更难回答。本文首发于赢政天下(https://www.winzheng.com/article/meta-muse-personal-ai-agent-trust)获取更多深度技术内容与资源欢迎访问官网。
返回列表