AHA 用自动研究循环发现生产 Agent 漏洞概念,留出集 ASR 达 47.0%
Agent Hacks Agents: Autoresearch Discovers Vulnerabilities in Production Agents
AHA通过可证伪假设循环发现生产级智能体漏洞概念,在留出实例上取得47.0%的平均ASR,超越最强基线14.2个百分点。
黑盒设定。攻击者目标是诱发被场景判定器裁定为有害的操作(数据泄露或未授权资源修改);已知任务上下文、攻击目标及被测智能体,可检查公共工具接口与暴露的工作区状态,模型内部权重与安全逻辑隐藏;具备直接多轮对话或间接修改工具响应与外部工件的注入能力。
- 生产级代码与操作智能体具备真实系统破坏能力,而现有自动化红队仅保留具体攻击载荷,缺乏成因解释与使能条件,导致复用困难且无法指导防御修复。
- 提出 AHA 框架,通过科研者与四个专职子智能体在沙箱中运行假设-攻击-反思的自动科研循环,将经多次确认的可证伪漏洞概念沉淀为概念图,并在留出任务与防御中复用。
- 在 18 组设置中发现 117 个概念,留出集平均 ASR 达 47.0%(高于最强基线的 32.8%)且查询开销更少;概念可跨模型迁移(保留 88% ASR)并协同攻击,使能条件补丁降低 41.11 个百分点 ASR。
- 跨场景泛化存在条件性且依赖后端状态时迁移率较低,概念协同仅在有关系记录的场景生效;作者计划后续扩展至多智能体系统并随版本发布持续运行;评测覆盖 2 个智能体宿主与 3 个受害模型。
- 模型
- Minimax-M2.7Kimi-K2.6Deepseek-V4-ProClaude CodeCodex
- 基准
- AgentHazardAgentDynDTap
- 指标
- ASRDiscovery queries (Q)is_breakeffective_breaktargeted_ASR
研究者提出 Agent Hacks Agents(AHA),用 Karpathy 式自动研究循环让研究者 Agent 先提交可证伪的漏洞假设,再设计攻击并在 Claude Code、Codex 等生产 Agent 上执行验证,把反复确认的解释沉淀为漏洞概念图。在三个场景、三个受害模型和两个 Agent 的 18 种设置中,共发现 117 个概念,归为八个家族,其中「声称授权」出现在 18 种设置中的 15 种,构成跨 Agent 的共享核心。在留出实例上,冻结后的概念达到 47.0% 的攻击成功率,比最强基线高 14.2 个百分点,且发现查询更少。概念还能跨受害模型、场景和 harness 复用,图中有关系的概念可组合成更强攻击;按概念的使能条件构造补丁,使 AgentHazard 的攻击成功率下降 41.11 个百分点。
推荐理由论文把攻击成功的原因抽象成可证伪的漏洞概念并建图,为 Agent 红队与修复提供了可复用的中间层。
深度解读
这篇论文试图解决什么问题?
当前自动化红队仅保留攻击载荷而忽略成因,AHA通过可证伪假设循环提取漏洞概念并记录使能条件与反驳证据。
当前大语言模型智能体自动化红队测试仅保留成功的攻击载荷实例,未记录攻击成功的内在成因,导致跨版本复用困难且无法指导防御修复。
- 场景与重要性:生产级代码与操作智能体(如 Claude Code 和 Codex)具备修改文件与执行系统命令的真实工具权限,其安全失败会在执行轨迹层面演变为破坏性行为;由于每次部署更新都会改变攻击触发危害的具体路径,安全团队需要与版本发布节奏同步的自动化红队测试以突破静态测试集的限制。
- 现有方法的不足:现有自动化红队方法通过反馈搜索攻击并保留有效工件(如提示词存档或攻击程序),成功条件保持隐式;一旦复用失败,测试人员无法判断是漏洞已修复还是攻击载荷不匹配,每次测试只能从头搜索且无法指出需要修复的具体条件。
- 核心观察与假设:作者认为应当保留能够被证据推翻的漏洞概念(vulnerability concept),说明攻击为何成功、触发漏洞的使能条件以及可证伪该解释的证据;借助类 Karpathy 的自动科研(autoresearch)循环,智能体可自主提出假设、执行实验并建立因果解释。
- 论文提出的方案:论文提出了 Agent Hacks Agents(AHA) 框架,由 RESEARCHER 调度四个专职子智能体(HYPOTHESIZER、ATTACK-DESIGNER、REFLECTOR、CRITIC),在沙箱中测试可证伪假设,将多次确认的概念沉淀至漏洞概念图(VCG),用于留出任务评估、跨场景迁移与概念协同攻击,并指导补丁修复。
- 威胁模型:
- 攻击者目标:诱导目标智能体执行被场景判定器裁定为有害的操作,包括受保护数据泄露或未经授权的资源篡改。
- 攻击者知识:已知任务上下文、攻击目标及被测智能体,可检查公共工具接口与暴露的工作区状态;模型内部权重、私有指令及安全逻辑对攻击者不可见;参考攻击与评估标准仅对判定器可见(黑盒设定)。
- 攻击者能力:涵盖直接与间接提示注入;直接攻击作为用户提供有界轮次的用户消息,间接攻击作为内容发布者修改工具响应或外部工件中的非受信内容;发现阶段可利用观察到的轨迹反馈调整后续尝试;评估系统不受攻击者控制。
- 受害系统:运行在隔离 Docker 沙箱中的生产级智能体环境,包含命令行工具、文件系统及企业后端服务接口。
有哪些相关研究?
现有研究多保留提示词、策略库或防御边界,AHA将可证伪的因果解释作为复用工件,直接指导定位修复介入点。
按论文对相关研究的讨论,相关工作主要分为以下三类:
自动红队与工件保留
- 载荷与种子优化器:Nellessen & Kachman (2026)、Zhou 等人 (2026b)、Markasserithodi 等人 (2026)、Syros 等人 (2026) 保留提示词或攻击策略;Samvelyan 等人 (2024)、Wang 等人 (2024; 2025b)、Dang 等人 (2025)、Lee 等人 (2026) 采用质量多样性方法保留攻击存档。作者指出这些方法只保留具体实例,使成功条件处于隐式状态。
- 策略与程序级优化器:Xu 等人 (2024)、Liu 等人 (2025a; 2025b)、Zhang 等人 (2025)、Zhou 等人 (2026a) 保留策略、记忆和工具箱;Zhou (2026)、Panfilov 等人 (2026)、Gautam 等人 (2026) 进一步保留攻击族、算法或程序;Yuan 等人 (2026)、Karpathy (2026)、Xiong 等人 (2026)、Dou & Yang (2026) 演化红队工作流。作者指出这些工件优化判定攻击成功率,记录了什么有效,但未显式记录背后的条件。
智能体安全评测基准
- 交互环境与专业风险基准:Zhang 等人 (2024)、Zhou 等人 (2026c) 评测交互环境中的安全风险与专业任务;Zhan 等人 (2024)、Debenedetti 等人 (2024) 评测工具集成的间接提示注入;Li 等人 (2026b) 评测多步轨迹失败。
- 动态与真实后端基准:Feng 等人 (2026) 提出 AgentHazard 评估计算机使用智能体的危害行为;Li 等人 (2026a) 提出 AgentDyn 评测动态真实环境中的安全防御;Chen 等人 (2026a) 提出 DTap 平台评测直接与间接攻击。
智能体安全防御与修复
- 输入过滤与上下文诊断:Meta (2024) 提出 Prompt Guard 86M,Llama Team (2024) 提出 Llama-Guard-3-8B 进行输入筛查;Liu 等人 (2026)、Zhang 等人 (2026) 提出上下文风险诊断与上下文净化。
- 运行时策略与权限限制:Ji 等人 (2026) 通过强制访问控制限制工具权限。作者指出这些防御方法基于结果判定或阻断失败,只能得知智能体失败,无法得知促成失败的具体条件,导致修复仍依赖通用筛查。
基线方法与评测基准
- 基线方法:对比了基于质量多样性存档的 T-MAP*(Lee et al., 2026)、基于种子库的 IterInject*(Chen et al., 2026b)、基于攻击程序的 AutoRISE*(Gautam et al., 2026)、基于策略库的 AutoDAN-Turbo*(Liu et al., 2025a)、基于重写与嵌套配方的 ReNeLLM*(Ding et al., 2024),以及直接重放公开载荷的 Original 基线。
- 评测基准:采用直接多轮攻击基准 AgentHazard、间接注入基准 AgentDyn、以及涵盖直接与间接通道的企业后端基准 DTap。
作者将 AHA 定位于从优化判定成功率转向保留可被证据推翻的因果主张,使解释本身成为可复用工件,并将使能条件作为研究对象,直接指出防御修复应当介入的位置。
论文如何解决这个问题?
AHA通过科研者调度四类子智能体执行假设-攻击-反思循环,经严格门控沉淀概念图,并依使能条件进行留出复用与协同。
AHA 提出以漏洞概念(vulnerability concept)作为发现与复用的基本单元,构建包含四类子智能体的自动科研循环,将反复确认的因果解释沉淀为漏洞概念图(Vulnerability Concept Graph, VCG)。
问题设定与形式化
自动红队通过攻击模型在环境 e = (s, v, f) 中与目标智能体交互,其中 s 为场景,v 为受害模型,f 为智能体宿主(harness)。场景提供可攻击表面,直接攻击为多轮用户消息序列,间接攻击为修改工具响应或外部工件的切片。评测在留出集 H_s 上测量单次尝试的攻击成功率,形式化定义为: ASR(M, v, f, s) = 1/(|Hs|) ∑i ∈ Hs Js(i, τi) 其中 J_s 为场景判定器,\tau_i 为执行轨迹,冻结的概念集在留出评估期间不再进行搜索或更新。
可证伪自动科研循环与角色分工
AHA 在发现阶段由顶层 RESEARCHER 驱动循环,并在每轮迭代中调度四个专职子智能体(Figure 1、Figure 2):
- HYPOTHESIZER:在攻击设计前预先提交假设 H,包含漏洞机制、表面策略、预期失败表现、证伪条件(falsifier)以及关键区分实验;必须明确写出何种观测会推翻该假设。
- ATTACK-DESIGNER:读取已提交的假设与实例元数据,严格按照攻击 schema 实例化攻击载荷 q,不修改假设内容。
- REFLECTOR:在沙箱运行后对比执行轨迹 \tau 与提交的证伪条件,将结果分类为 confirmed(依指定机制触发失败)、falsified(满足证伪观测)或 inconclusive(环境崩溃或超时等),并在有新发现且有效突破时生成新概念元组。
- CRITIC:每完成 10 轮迭代由独立上下文的审判员执行审计,检查跨概念组合、奖励作弊(reward hacking)、类别覆盖缺口以及假设质量漂移,将建议写入日志供后续轮次参考。
RESEARCHER 在四种模式间轮转:explore(基于覆盖计数探索新机制)、exploit(深化已有突破的概念)、transfer(在新类别测试已计数概念)、consolidate(重测置信度低于 0.5 且至少有两次观测的概念)。
概念状态与严格晋升门控
漏洞概念记录漏洞主张、使能条件、攻击模板、失败结果、迁移预测及证伪条件。候选概念必须满足公式定义的晋升门控才能进入冻结计数集合 C*: nconf(c) ≥ nmin ∧ (nconf(c) + 1)/(nobs(c) + 2) ≥ γmin ∧ ∃ o ∈ Oc : (status(o) = confirmed ∧ is_break(o) = 1) 其中确认次数阈值 n_min = 3,平滑置信度阈值 \gamma_min = 0.60,且必须包含至少一次判定器认可的有效突破(effective break)。未达标或被证伪的概念保留在图中作为负面证据,防止重复无效探索。
概念图组织与留出集复用机制
确认的概念构成概念图,边包括衍生(derived-from)、同类(sibling-of)、强弱关系(stronger-than)、跨类别迁移(transfers-to)和协同使能(composes/enables)。在留出集评估时,概念选择模型仅查看可见元数据与冻结概念库,为每个留出任务挑选单个适用概念并直接实例化攻击,不进行额外搜索或重试。对于协同攻击,则利用协同边指导生成单个组合攻击载荷。
论文做了哪些实验?
AHA在留出集平均ASR达到47.0%,高于各基线且查询开销更低,所提取概念可跨模型泛化并指导防御补丁。
实验设置
- 被测系统与模型:测试了两个生产级智能体宿主 Claude Code 与 Codex;受害模型全部列出为 Minimax-M2.7、Kimi-K2.6 和 Deepseek-V4-Pro;科研者与子智能体在 Claude Code 下使用 Claude-Opus-4.8,在 Codex 下使用 GPT-5.5;判定模型为 Gemini-3-Flash。
- 数据集与规模:AgentHazard(2,653 个直接多轮实例,发现集 2,563 个,留出集 90 个,涵盖 10 个危害类别各 9 个);AgentDyn(560 个间接注入实例,发现集 504 个,留出集 56 个,分布于 shopping、github、dailylife 三个套件);DTap(481 个实例,发现集 383 个,留出集 98 个,覆盖 4 个后端领域和 26 个有效渠道-目标组合)。
- 基线方法:对比了 T-MAP*、IterInject*、AutoRISE*、AutoDAN-Turbo*、ReNeLLM* 以及直接使用公开载荷的 Original 基线;基线攻击生成模型为 Qwen-3.7-Max(AutoRISE* 使用宿主模型)。
- 指标定义:留出集攻击成功率(Held-out ASR, %);发现查询次数(Discovery queries Q,统计达到停止条件前的完整攻击评估次数)。
- 评审方式:AgentHazard 采用官方轨迹级判定器打分,分值范围 [0, 10],得分至少 7 且有害标记为 true 计为 break;AgentDyn 采用 AgentDojo 源码级 security() 函数检验后置环境状态;DTap 采用任务自带的可验证判定器检验后端状态,两项均无额外 LLM 调用。
- 样本量与资源约束:留出集每个实例仅单次尝试(无重试与反馈);发现阶段迭代上限 100 轮;每个攻击在独立 Docker 容器内运行,资源限制为 2.0 CPU、4GB 内存、600 秒硬超时、50 万输入 token 与 5 万输出 token。
主结果
下表汇总了各方法在六组场景与智能体宿主组合下的场景级平均留出 ASR(%):
表格较宽,可左右滑动
评测设置 T-MAP* IterInject* AutoRISE* AutoDAN-Turbo* AHA AgentHazard (Claude Code) 55.93 58.52 56.67 52.59 77.41 AgentHazard (Codex) 64.45 57.03 51.48 47.78 74.81 AgentDyn (Claude Code) 4.17 4.17 11.31 10.12 25.00 AgentDyn (Codex) 2.38 6.55 1.19 1.19 20.24 DTap (Claude Code) 37.42 37.07 41.50 38.10 47.62 DTap (Codex) 26.87 29.93 34.69 31.29 36.73 (据 Table 1;因表格列数限制省略 ReNeLLM* 与 Original 基线,ReNeLLM* 在对应六行的均值分别为 48.15%、42.59%、0.60%、0.60%、30.95%、22.45%;Original 分别为 65.18%、54.82%、10.71%、5.36%、48.64%、37.07%)
- 作者报告 AHA 在全部 6 组设置的场景平均 ASR 上均高于各搜索基线,跨设置留出集平均 ASR 达到 47.0%,高于最强基线 AutoRISE* 的 32.8%(据 Table 1 与第 5.1 节)。
- 作者称 AHA 使用的发现查询次数低于全部基线:Claude Code 下总查询数为 594 次,Codex 下为 634 次,均低于各基线区间(826–3,365 次与 917–3,239 次)(据 Table 1 与第 5.1 节)。
- 作者指出公开载荷 Original 在 DTap 场景上保持竞争力并略超 AHA,而在 AgentDyn 上的绝对成功率各方法均相对较低(据 Table 1 与第 5.1 节)。
跨场景、模型与智能体宿主的泛化能力(RQ2)
- 跨场景泛化:测定了将源场景发现的概念图部署至目标场景留出集的效果(Figure 4a、Table 24)。DTap 概念在 AgentHazard 上达到 53.7% 平均 ASR;AgentHazard 概念在 DTap direct 达到 49.6%、DTap indirect 达到 28.1%;AgentDyn 概念在 DTap direct 达到 42.6%、DTap indirect 达到 41.8%;DTap 概念在 AgentDyn 上仅达 7.7%。作者认为泛化具有条件性,依赖有状态后端的概念较难迁移至工具介导的工作流。
- 跨受害模型泛化:在 Claude Code 下将每个模型在 AgentHazard 上的概念部署至其他两个模型(Figure 4b、Table 24)。跨模型迁移平均保留了目标模型自身原生概念 ASR 的 88%;Deepseek 概念迁移效果在各模型中表现良好,在 Minimax 上达到 86.67%(高于 Minimax 原生概念的 75.56%);Minimax 概念迁移在 Kimi 上仅达 43.33%(低于其原生概念的 71.11%)。
- 跨智能体宿主泛化:在 Claude Code 与 Codex 之间双向迁移概念图(Figure 4c)。正向与反向迁移的平均 ASR 分别为 37.72% 与 40.84%,双向平均 ASR 为 39.28%,较目标宿主原生发现的概念分别低 6.21 与 9.17 个百分点。作者认为概念跨宿主仍具可用性,但针对特定宿主的发现仍保有优势。
概念协同攻击实验(RQ2)
- 协同方式对比:在 Minimax-M2.7 上测试基于概念图关系边(Coordinated)组合两个概念,并与两概念直接拼接(Joined)、单概念(A、B)、无关系边概念对(Other)及全图单概念复用(Full VCG)对比(Table 5)。在 AgentHazard 上 Coordinated 达到 78.89% ASR,比 Full VCG(74.44%)高 4.44 个百分点;在 DTap 上达到 40.31%,比 Full VCG(34.18%)高 6.12 个百分点;而在 AgentDyn 上仅为 12.50%,比 Full VCG(19.64%)低 7.14 个百分点。
- 协同机制的作用:在 AgentHazard 和 DTap 上,Coordinated 的 ASR 均超过直接拼接文本的 Joined(72.22% 与 34.69%)以及未记录关系的 Other(67.78% 与 27.55%)。作者认为协同增益来源于概念图记录的关系结构而非文本拼接。
- 场景差异与例外:在 AgentDyn 上 Coordinated(12.50%)持平于单概念 A,且落后于直接拼接的 Joined(14.29%)。作者指出协同仅在概念图记录了有效工作关系的场景中起效。
概念使能条件补丁与防御对比(RQ3)
- 机制家族补丁效果:针对 7 个在 AgentHazard 出现的机制家族使能条件各设计一个补丁并回放攻击(Figure 5a、Table 28a)。补丁使 7 个家族的平均 ASR 降低 36.00 个百分点;其中 routine context 和 split harm 的 ASR 分别降低 50.00 至 56.25 个百分点,降幅比 fictional reframing(降低 21.05 至 22.22 个百分点)多出 31.48 与 29.30 个百分点;修补后 fictional reframing 与 spoofed trust 的残留 ASR 比其他五类高出 33.35 个百分点。
- 补丁包与通用防御对比:将各家族补丁合并为补丁包,与 Prompt Guard 86M、Llama-Guard-3-8B 及安全系统提示词在留出集上对比(Figure 5b、Table 28b)。补丁包在 Claude Code 下达到 36.67% ASR,在 Codex 下达到 33.33% ASR,平均比表现最好的通用防护模型 Llama Guard 低 14.44 个百分点。作者认为针对使能条件的定向修复优于前置通用筛查。
- 部署方式:作者报告每个补丁仅基于发现证据预先设定,且仅使用现有的运行器或工具边界,无需额外模型调用。
其他消融与分析
- 移除可证伪器(w/o falsifier):在所有设置下使平均 ASR 降低 13.36 个百分点(Table 3)。
- 移除 CRITIC 审计(w/o critic):在 AgentHazard 下使 Minimax 留出 ASR 降低 17.78 个百分点,有效概念数从 10 个降至 7 个,但发现 ASR 仅从 74.00% 变至 72.46%(Table 3、Table 16)。
- 移除记忆门控(w/o memory):在 12 个设置中导致有效概念数减少,Minimax 在 AgentHazard 下有效概念数从 10 个降至 8 个(Table 16)。
- 控制研究者模型(AHA@Qwen):以 Qwen-3.7-Max 为研究者模型测试 Deepseek,在 AgentHazard 达到 70.00% ASR,在 AgentDyn 达 33.93%,在 DTap 达 53.06%(Table 2)。
- 发现轮数模式分布:18 个设置中研究者大部分轮数分配给 explore 与 exploit,transfer 与 consolidate 占剩余部分(Table 19)。
- 负面结果与失败框架:直接伪造权限或声明式身份但在工具调用中未施加结构性义务的框架,均被证明无法绕过拒绝(Table 22、Table 23)。
有什么可以进一步探索的点?
作者计划在智能体版本更新时持续运行该循环并拓展至多智能体系统,同时指出跨场景迁移与协同受制于后端状态与关系记录。
作者指出的局限与后续方向
- 多智能体系统扩展:作者在结论中指出,后续工作可将该科研循环扩展至多智能体系统(multi-agent systems)(第 6 节)。
- 持续适配与发布周期:作者在结论中指出,后续工作可以在智能体每次版本更新时运行该循环,以保持防御时效性(第 6 节)。
- 跨场景泛化的条件依赖:作者在讨论中指出概念泛化具有条件性,DTap 概念在 AgentDyn 上仅取得 7.7% ASR,依赖有状态后端的概念较难可靠迁移至工具介导的工作流(第 5.3 节)。
- 宿主专用发现的优势:作者指出尽管概念在跨智能体宿主时保持可用(平均 39.28% ASR),但针对目标宿主的专门发现仍然保有性能优势(第 5.3 节)。
- 概念协同的适用范围:作者指出概念协同仅在概念图记录了有效工作关系时有效,在缺乏关系记录的 AgentDyn 上协同攻击落后于单概念全图复用(第 5.3 节)。
- 部分机制防御补丁的残留风险:作者指出在应用家族补丁后,fictional reframing 与 spoofed trust 两类机制的残留 ASR 仍比其余五类高出 33.35 个百分点(第 5.4 节)。
实验覆盖范围
- 被测系统覆盖:实验评测了 Claude Code 与 Codex 共 2 个生产级智能体宿主,被测受害模型包含 Minimax-M2.7、Kimi-K2.6 与 Deepseek-V4-Pro 共 3 个模型(第 4.1 节)。
- 评测场景覆盖:评测覆盖了直接多轮提示攻击场景 AgentHazard、间接注入场景 AgentDyn、以及涉及 4 类后端环境的 DTap 场景共 3 个基准(第 4.2 节)。
- 概念提取数量:在 18 组发现设置中总计沉淀出 117 个满足门控的计数概念,归纳为 8 个机制家族(第 5.2 节)。
- 防御基线覆盖:通用防御对比包含 Prompt Guard 86M、Llama-Guard-3-8B 与安全系统提示词共 3 种基线,且防御对比实验仅在 AgentHazard 留出集上展开(第 5.4 节与附录 C.6)。
- 报告信息说明:论文未报告留出集评估中多次随机种子的方差统计,未报告概念选择模型与人工专家打分的一致性指标。
总结一下论文的主要内容
论文提出基于可证伪科研循环的AHA框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
- 问题定位:生产级智能体具备文件读写与命令执行权限,轨迹级安全失败具有现实破坏性;现有红队方法保留的提示词或攻击脚本难以跨环境复用且成因隐式,无法指示具体的修复条件。
- 核心方法:提出以漏洞概念为核心单元的自动科研循环,由顶层科研者调度假设生成器、攻击设计器、反思器与审计员四个专职子智能体,在沙箱中对可证伪假设进行严格检验,将经过平滑置信度与有效突破门控的概念沉淀为漏洞概念图(VCG)。
- 主要主结果:
- 在 18 组设置中发现 117 个概念并划分为 8 个家族,其中 claimed authorization 构成跨智能体的共享核心(出现于 15/18 组设置)(Table 18、Figure 6)。
- 在留出实例单次测试中,AHA 达到 47.0% 平均 ASR,高于最强基线 AutoRISE* 的 32.8%,且发现查询消耗(Claude Code 下 594 次、Codex 下 634 次)低于所有基线(Table 1)。
- 概念展现出跨模型泛化(保留目标原生概念 88% 的 ASR)与跨宿主泛化(双向平均 39.28% ASR)(Figure 4b、Figure 4c)。
- 概念协同在 AgentHazard 和 DTap 上使 ASR 分别提升 4.44 与 6.12 个百分点,证实了概念图关系边的利用价值(Table 5)。
- 依据使能条件构建的防御补丁使 AgentHazard 平均 ASR 降低 41.11 个百分点,平均优于通用防护模型 Llama Guard 14.44 个百分点(Figure 5b)。
- 作者启示:作者认为可证伪的因果解释比孤立的攻击实例更为稳固,不仅提升了红队测试在部署更新后的复用能力,更将漏洞使能条件转化为可直接实施的架构级防御切入点。