宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响
Threat-Preserving Representation Sensitivity in Agent-Security Benchmarks
论文测试3个智能体安全基准,发现中立化工具名使ASB上GPT-5-mini的committed ASR提升11.67个百分点。
- 智能体安全基准常以攻击成功率(ASR)衡量模型鲁棒性并比较防御,假设分数反映智能体安全。然而基准对环境与威胁的表征选择会作为输入影响模型。关键问题在于:保持底层任务与评测不变时,基准测得的安全得分有多稳定。
- 提出威胁保持表征敏感性(TPRS),在底层任务、危害行为、环境和评测准则固定下仅改变智能体可见的表征。在 ASB、MCPTox 和 AgentDojo 上构建正字法、语义中立与线索改变等表征分支进行测量。
- 基于 28,904 次运行发现表征敏感性较大且非均匀:ASB 中立化工具名使 GPT-5-mini 的 committed ASR 升 11.67 个百分点;MCPTox 加威胁词使其 ASR 降 11.00 个百分点,且形式匹配中立名复现了大部分降幅;AgentDojo 的 ASR 变化接近零。
- 测试的转换未穷尽,仅改动工具名与描述;敏感性归因不完整,未完全剥离标识符各项属性;实验仅覆盖 3 个基准与 3 种模型配置,未评估防御及排名翻转;运行间因共享转换存在非独立性。
- 模型
- GPT-5-miniClaude Haiku 4.5GPT-4o-mini
- 基准
- Agent Security Bench (ASB)MCPToxAgentDojo
- 指标
- ASRcommitted ASRnative ASRbenign utilityTPRS
宾州州立大学研究者提出威胁保持表示敏感性(TPRS),衡量在任务、有害动作、安全策略、真值和评测标准不变、仅改变 Agent 可见表示时攻击成功率(ASR)的变化幅度。在 ASB、MCPTox 和 AgentDojo 三个基准共 28,904 次 Agent 运行中,ASR 变化方向不一致:ASB 把威胁相关工具名换成中性名后,GPT-5-mini 的 committed ASR 上升 11.67 个百分点,Claude Haiku 4.5 上升 13.21 个百分点;MCPTox 把中性名换成威胁相关名后,GPT-5-mini 的 ASR 下降 11.00 个百分点,Haiku 4.5 下降 4.11 个百分点;AgentDojo 在 GPT-4o-mini 上 ASR 仅变化 0.50 个百分点,但需要该工具的任务上良性效用下降 5.36 个百分点。
推荐理由论文用近 2.9 万次 Agent 运行量化了工具命名等表示变化对 ASR 的影响,做 Agent 安全评测的团队可据此检查自己的基准是否对表示敏感。
深度解读
这篇论文试图解决什么问题?
论文探究智能体安全基准测得的 ASR 在底层任务与评测标准固定而威胁表征改变时的稳定性。
智能体安全基准测得的攻击成功率(ASR)是否过度依赖基准对威胁的表征方式,而非仅仅反映智能体模型的实际鲁棒性。
- 场景与重要性:安全基准常使用 ASR 衡量基于大语言模型的智能体鲁棒性并评估防御策略,这些评估通常假定分数准确描述了智能体的安全性。
- 现有基准的局限:基准必须决定如何向模型呈现环境与攻击,包括工具名称、描述及指令措辞;这些选择成为模型输入的一部分,但现有基准往往将单一表征视作测量中立的。
- 核心观察与假设:作者认为大语言模型智能体会根据上下文条件化行为,若保持底层任务、攻击机制与评测准则不变,仅改变威胁的表征,测得的 ASR 可能会发生偏离。
- 论文提出的方案:作者提出了威胁保持表征敏感性(Threat-Preserving Representation Sensitivity, TPRS),用于量化表征变动对基准安全得分的影响。
- 被测环境的威胁设定:作者审计了三种攻击架构的基准,其中 ASB 包含独立恶意工具,MCPTox 在良性工具描述中投毒,AgentDojo 则通过未信任工具输出诱导滥用普通工具。
有哪些相关研究?
论文梳理了智能体安全基准、智能体表征与上下文敏感性,以及基准测量有效性三类相关工作。
论文梳理了与智能体安全评测、上下文敏感性及基准有效性相关的三类工作:
智能体安全基准
- InjecAgent(Zhan 等,2024)与 AgentDojo(Debenedetti 等,2024):InjecAgent 评估工具集成大语言模型智能体的脆弱性;AgentDojo 通过测量良性任务效用和提示词注入易感性,评估在未信任数据上执行普通工具的智能体。
- Agent Security Bench / ASB(Zhang 等,2025)与 MCPTox(Wang 等,2026):ASB 在多种场景和工具下全面评估攻击与防御;MCPTox 则研究模型上下文协议(MCP)设置下的工具投毒攻击。
- 基于基准的防御评估工作:Task Shield(Jia 等,2025)、MELON(Zhu 等,2025)和 CaMeL(Debenedetti 等,2026)使用 AgentDojo 报告攻击成功率与任务效用,以检验防御对攻击的拦截及良性功能的保留情况。
大语言模型智能体的表征与上下文敏感性
- 工具元数据与格式敏感性:Faghih 等(2025)修改工具描述发现工具调用量变动超一个数量级;BiasBusters(Blankenstein 等,2026)表明工具选择高度依赖查询与元数据的匹配;Pan 等(2026)指出模式格式化的工具规范会削弱拒绝并增加不安全执行;de Zarza 等(2026)测试了释义和重排等保持语义的重写对智能体推理的影响。
- 评测感知与上下文线索:Needham 等(2025)指出模型能区分评测上下文与实际部署交互;Li 等(2026)独立改变评测环境因素;Nayan 等(2026)测量评测框架下的行为差异;Deckenbach 等(2026)指出用描述安全评测设计文档训练的模型在安全基准上表现更优。
基准与测量有效性
智能体基准缺陷分析:Zhu 等(2025)提出智能体基准检查清单(ABC)指出可能导致测量偏差的缺陷;Wang 等(2026)审计了四个智能体安全基准,指出结论取决于目标行为、指标与模型面板;Qu 等(2026)指出代码智能体行为取决于基准对授权范围的表述;Gringras(2026)表明单选改简答会导致安全得分变动 5–20 个百分点。
可信机器学习测量问题:Yu 等(2025)、Meeus 等(2025)和 Thaker 等(2025)分别在对抗迁移性、成员推断和机器遗忘领域指出,评测过程与数据集构建可能混淆安全结论。
对比基准:论文直接选用已发表的 Agent Security Bench (ASB)、MCPTox 和 AgentDojo 作为实验测量对象,以其原始表征作为基线。
与既有工作的定位区别:作者指出,既有上下文敏感性研究通常在改变模型或提示环境时考察行为,而本文聚焦于更窄的基准测量问题:在定义结果的安全问题本身保持不变时,基准的安全得分在受控表征变化下会发生多大偏移。
论文如何解决这个问题?
论文形式化定义了保持底层安全问题不变的 TPRS,并在三个基准上构建受控表征变换分支。
论文通过定义威胁保持表征敏感性(Threat-Preserving Representation Sensitivity, TPRS)来审计基准得分的稳定性,在保持底层安全问题完全不变的前提下,系统改变智能体可见的表征并测量 ASR 变化。
问题设定与形式化
- 基准实例的六要素分解:论文将基准实例分解为环境、攻击者目标、违规策略定义、攻击成功准则、评估机制以及向智能体展示的信息(智能体可见表征)六个组件。
- 威胁保持变换的定义:变换保持前五个组件严格固定,仅改变智能体可见表征,攻击目标、违规判定与环境状态评分代码保持不变,且文本匹配规则通过 SHA-256 验证保持逐字节一致。
- TPRS 指标形式化:TPRS 定义为模型在变换后基准与原始基准上的攻击成功率差值,即: ΔT(B, m) = ASR(T(B), m) − ASR(B, m) 该指标量化了在底层威胁不变时,仅由表征变换引起的攻击成功率波动幅度。
表征变换的类型设计
- 正字法变换(Orthographic):仅改变拼写、大小写或标点符号而不故意改变含义(例如将 DNSPoisoning 改为 DNS_Poisoning),用于测试 ASR 是否对微小表征变化产生响应。
- 语义中立变换(Semantic-neutral):替换词汇但不引入任何威胁相关词汇(例如将 read_file 改为 fetch_file),用于检验单纯描述性内容的变动是否会引起得分偏移。
- 线索改变变换(Cue-altering):在保持威胁本质的同时改变特定的威胁词汇(例如将 DNSPoisoning 改为 DNSConfiguration,或向普通工具添加恶意相关词汇)。
面向三个基准的针对性构建
- ASB 的表征分支:包含原始基线 A0、正字法分支 NULL2、工具名中立化 A1、描述中立化 A1b 以及名称和描述均中立化 A3(诊断分支 A2 因改动任务文本不属于威胁保持变换);A1 中 36 个攻击工具中的 32 个因含威胁词而被重命名。
- MCPTox 的表征分支:包含原始基线 N0、正字法分支 O1/O2/NULL2、中立替代名 S1/S2、在 token 数量、长度和大小写上与 N1 匹配的形式对齐中立分支 S3、保守威胁词分支 C1 以及显式威胁类别名分支 N1。
- AgentDojo 的表征分支:针对提示词注入诱导普通工具的场景,设计原始基线 D0、正字法分支 Dnull、对攻击必需工具增加威胁词分支 Dval 以及对不相关工具增加威胁词分支 Dirrelevant。
生成冻结与统计评测协议
- 候选词生成与冻结:基于分词器统计数据、固定威胁词典及原始标识符属性进行确定性替换并计算哈希保存,严禁依据模型输出结果重新筛选变换。
- 评测指标定义:ASB 同时报告触发工具即算成功的原生 ASR(native ASR)以及额外要求智能体全程不拒绝的提交 ASR(committed ASR);AgentDojo 则同时评测安全 ASR 与良性任务效用。
- 统计检验与聚类:采用 10,000 次聚类自助抽样(cluster-bootstrap)计算 95% 置信区间,MCPTox 采用 Holm 校正控制族错误率。
论文做了哪些实验?
论文在三个基准上完成 28,904 次运行,发现表征变化引起了不同方向和幅度的 ASR 偏移。
实验设置
- 被测模型:GPT-5-mini(推理努力程度设为 low,温度不可调,4096 completion budget)、Claude Haiku 4.5(MCPTox 上温度为 0 且 token 预算为 1024,ASB 上使用 API 默认温度且 token 预算为 4096)、GPT-4o-mini(AgentDojo 原生环境,温度为 0)。
- 数据集与基准规模:ASB 包含 6 个领域的 36 个攻击工具,每个工具 5 个任务,6 个分支,3 次重复,共 3,240 次运行/模型;MCPTox 选取满足执行评分双信号的 203 个用例(来自 1,348 个候选),9 个分支,3 次重复,共 10,962 次运行;AgentDojo 包含 40 个用户任务与 14 个注入任务(主安全分析使用必需重命名工具的 4 个任务,每分支 160 个基准用例),共 11,462 次运行。全部基准合计完成 28,904 次运行。
- 基线方法:各基准的原始未修改表征(ASB 为 A0,MCPTox 为 N0,AgentDojo 为 D0)。
- 指标定义:ASB 报告 native ASR(调用恶意工具即算成功)与 committed ASR(调用且全程未拒绝);MCPTox 报告执行评分器判定的 ASR;AgentDojo 报告基于环境状态判定的 ASR 与良性任务效用。
- 评审与判定方式:ASB 使用固定关键词匹配检测拒绝,文本匹配规则经 SHA-256 严格核对;MCPTox 可执行评分器具有 95.3% 召回率和 0.7% 假阳性率;AgentDojo 使用原基准自带的状态评分器。
- 样本聚类与重复:每个条件进行 3 至 5 次重复运行;统计分析在变换应用的层次进行聚类(ASB 按工具聚类,MCPTox 按用例聚类,AgentDojo 按基准用例聚类),基于 10,000 次重抽样报告 95% 置信区间。
主结果
下表汇总了三个基准在核心线索改变分支下的主实验结果(据 Table V、Table VII、Table VIII):
表格较宽,可左右滑动
基准 评估模型 变换分支(类型) 原始基线 ASR ASR 变化量 95% 置信区间 ASB GPT-5-mini A1 工具名中立化(committed) 36.67% +11.67 个百分点 [+4.44, +19.07] ASB Claude Haiku 4.5 A1 工具名中立化(committed) 20.85% +13.21 个百分点 [+6.33, +21.10] MCPTox GPT-5-mini N1 显式威胁命名 32.02% -11.00 个百分点 [-15.60, -6.57] MCPTox Claude Haiku 4.5 N1 显式威胁命名 9.03% -4.11 个百分点 [-7.55, -0.99] AgentDojo GPT-4o-mini Dval 必需工具威胁命名 22.74% -0.50 个百分点 [-3.65, +2.51] - 敏感性方向与威胁显式程度相关:作者称,ASB 移除威胁词后 ASR 上升,而 MCPTox 增加威胁词后 ASR 下降,二者在威胁显式程度维度上方向一致,即更显式的威胁表征对应更低的 ASR(据 Section IV)。
- 不同基准间敏感性幅度存在差异:作者指出 ASB 与 MCPTox 表现出较大幅度的敏感性,而 AgentDojo 的 ASR 变化接近于零,表明表征敏感性并非在所有基准上都必然很大(据 Section IV-C)。
- 评价指标定义影响敏感性估计:作者称在 ASB 中原生 ASR 与 committed ASR 的变化幅度不同,说明表征敏感性不仅取决于表征本身,还取决于基准如何定义攻击成功(据 Section IV-A)。
MCPTox 的词汇与形式控制实验
- 测试内容:为了探究 N1 导致的 ASR 下降是否源于显式威胁词汇本身,设计了在 token 数量、长度和大小写上与 N1 严格对齐的中立分支 S3,以及保守威胁词分支 C1 和语义中立分支 S1/S2(据 Section III-B 与 Section IV-B)。
- 实验结果:在 GPT-5-mini 上,单纯形式对齐的中立分支 S3 相比原始 N0 使 ASR 下降了 8.54 个百分点(95% CI [-12.48, -4.76]);N1 相对于 S3 仅进一步下降 2.46 个百分点(95% CI [-5.58, +0.66])。在 Claude Haiku 4.5 上,S3 相比 N0 的变化为 -0.16 个百分点(95% CI [-3.94, +3.61]),N1 相比 S3 下降 3.94 个百分点(95% CI [-7.22, -0.82],但未通过 Holm 校正,padj = 0.068)(据 Table VII)。
- 作者解读:作者认为显式威胁词汇并非导致 GPT-5-mini 产生大部分 ASR 偏移的必要条件,标识符的形式属性复现了大部分效应;而在基线 ASR 仅为 9.03% 的 Haiku 4.5 上证据尚不明确。
AgentDojo 的安全性与良性效用分离实验
- 测试内容:测试向提示词注入攻击所需工具添加威胁词(Dval)以及向无关工具添加威胁词(Dirrelevant)对攻击成功率与良性任务效用的影响(据 Section IV-C 与 Table VIII)。
- 实验结果:在 GPT-4o-mini 上,Dval 使安全 ASR 仅变动 -0.50 个百分点(95% CI [-3.65, +2.51]);但在需要重命名工具的良性任务上,效用下降 5.36 个百分点(从 33.93% 降至 28.57%,95% CI [-10.00, -0.71]),而未修改依赖的其他任务效用上升 5.24 个百分点(95% CI [+3.51, +7.03]),两类任务效用差异为 -10.59 个百分点(95% CI [-15.87, -5.69])(据 Table VIII)。
- 作者解读:作者指出模型在相关任务中对重命名工具的调用率仍达 99.6%(Dval 与 D0 相同),表明良性效用变化无法通过避免调用该工具来解释;由于未改动任务效用出现同等幅度上升,作者将该效用效应视为提示性而非已确证的结论。
ASB 执行失败与逐工具排除鲁棒性分析
- 测试内容:评估 Claude Haiku 4.5 上的执行失败(A0 为 4.1%,A1 为 5.9%)以及单个工具对 A1 效应的影响(据 Section IV-A 与 Table VI)。
- 实验结果:在丢弃失败运行、将失败视为未提交攻击、将失败视为已提交攻击三种规则下,Haiku 4.5 的 A1 效应估计值分别为 +13.21、+12.04 和 +13.89 个百分点,且置信区间均保持在零以上(据 Table VI);逐一排除 36 个攻击工具时,A1 效应在 GPT-5-mini 上保持在 9.90 至 12.95 个百分点之间,在 Haiku 4.5 上保持在 11.19 至 14.40 个百分点之间。
- 作者解读:作者认为 A1 的命名敏感性效应并不由个别攻击工具驱动,且对模型执行失败的处理方式保持稳健。
其他消融与分析
- 正字法重命名(NULL2):在 ASB 上 GPT-5-mini 的 committed ASR 变动 -1.67 个百分点,Haiku 4.5 变动 -0.74 个百分点(据 Table V)。
- 仅中立化工具描述(A1b):在 ASB 上 GPT-5-mini 的 committed ASR 变动 +0.00 个百分点,Haiku 4.5 变动 -1.16 个百分点(据 Table V)。
- 同时中立化名称与描述(A3):在 ASB 上 GPT-5-mini 的 committed ASR 提升 13.15 个百分点,Haiku 4.5 提升 14.85 个百分点(据 Table V)。
- 保守威胁词命名(C1):在 MCPTox 上 GPT-5-mini 的 ASR 变动 -2.96 个百分点,Haiku 4.5 变动 -2.63 个百分点(据 Table VII)。
- 诊断性具体化任务描述(A2):在 ASB 上 GPT-5-mini 的 committed ASR 提升 4.44 个百分点,Haiku 4.5 变动 -2.23 个百分点且伴随 22.4% 的执行失败率(据 Section IV-A)。
- 无关工具威胁命名(Dirrelevant):在 AgentDojo 上 GPT-4o-mini 的 ASR 变动 +0.88 个百分点(据 Table VIII)。
负面结果与例外
- 正字法变换未引起明确变化:正字法微小变动在三个基准上均未产生统计可分辨的 ASR 变化(ASB NULL2、MCPTox O1/O2/NULL2、AgentDojo Dnull 置信区间均跨越零)。
- 仅修改描述对提交成功率无显著影响:ASB 中仅修改描述(A1b)未能在任一模型上改变 committed ASR(GPT-5-mini 为 +0.00 点,Haiku 4.5 为 -1.16 点,置信区间跨越零)。
- 多重检验校正后显著性减弱:在 MCPTox 上,Holm 校正后的多重比较中,10 项假设检验仅有 1 项保持显著(GPT-5-mini 上 N1 对比 S1/S2),涉及 C1 的对比 padj 均大于等于 0.30。
- 跨模型效应差异不明显:在 ASB 上 GPT-5-mini 与 Haiku 4.5 在 A1 效应上的估计差异为 -1.54 个百分点(95% CI [-12.45, +8.44]),A3 差异为 -1.70 个百分点(95% CI [-12.00, +8.68])。
有什么可以进一步探索的点?
作者指出了变换类型未穷尽、机制归因不完全、模型与基准覆盖有限以及未测试排名翻转等局限。
作者指出的局限与后续方向
- 变换类型尚未穷尽:实验仅对工具名称和描述进行了变换,未涵盖参数名、工具模式(tool schemas)或指令表述等其他可能可见的表征;作者计划在未来测试更广泛的威胁表征方面(Section VI-a)。
- 表征语义等价性难以保持:使名称脱离威胁表征与维持原有功能语义之间存在权衡;ASB 的 A1 分支未独立验证语义等价性,可能同时改变了工具的外在威胁感和表观功能,而设计严格语义等价分支时因通过盲检的工具过少(32 个中仅 10 个)未能运行(Section VI-a)。
- 敏感性机制归因尚不完全:虽然 MCPTox 的 S3 分支表明威胁词汇并非主要驱动因素,但 S3 并未隔离标识符的所有属性,且分词器在跨模型(如 Haiku 4.5)时存在差异,未来需设计更严格的控制实验隔离语义、分词与结构属性(Section VI-b)。
- 实证评估范围有限:实验仅覆盖 3 个基准和 3 种模型配置(ASB 与 MCPTox 上的 GPT-5-mini、Claude Haiku 4.5,以及 AgentDojo 上的 GPT-4o-mini),未确立超出所测范围的泛化性;作者计划扩展至更多模型、基准、攻击与防御(Section VI-c)。
- 未检验模型或防御排名稳定性:基准得分常用于横向对比,但研究尚未验证模型或防御的相对排名在表征变换下是否会发生翻转(Section VI-d)。
实验覆盖范围
- 评测基准范围:实证评测覆盖 Agent Security Bench (ASB)、MCPTox 和 AgentDojo 共 3 个智能体安全基准。
- 被测模型范围:测试覆盖 GPT-5-mini、Claude Haiku 4.5 和 GPT-4o-mini 共 3 种模型配置,每个基准测试 1 至 2 个模型。
- 威胁架构与变换对象:测试覆盖恶意工具呈现、工具描述投毒和未信任输出间接注入 3 种攻击架构,变换对象覆盖工具名称和工具描述。
- 实验样本量与独立性:总计包含 28,904 次智能体运行;论文注明由于变换方案在不同运行间共享,各运行样本之间并非完全独立。
- 防御机制覆盖情况:评测覆盖了攻击基准但未包含具体的防御机制(论文明确将评估防御列为未来工作)。
总结一下论文的主要内容
论文审计了智能体安全基准的表征敏感性,发现工具命名变化可大幅改变 ASR,强调基准应评估表征变体。
- 论文定位:这是一项针对大语言模型智能体安全基准测量有效性的审计研究,探究基准对威胁的表征设计对安全评估得分稳定性的影响。
- 核心问题:现有多项基准使用攻击成功率(ASR)评估智能体鲁棒性并假定测量中立,但基准对工具命名、描述等表征的选择本身构成了模型输入,论文旨在探究底层安全问题不变时 ASR 分数在表征变换下的波动程度。
- 方法设计:研究提出了威胁保持表征敏感性(TPRS),在严格固定任务、攻击目标、危害行为、环境与评测标准的前提下,针对 ASB、MCPTox 和 AgentDojo 构建了正字法、语义中立和线索改变等受控表征分支。
- 主要发现:在 28,904 次运行中,ASB 中立化工具名使 GPT-5-mini 的 committed ASR 提升 11.67 个百分点、Claude Haiku 4.5 提升 13.21 个百分点(Table V);MCPTox 引入显式威胁命名使 GPT-5-mini 的 ASR 下降 11.00 个百分点,且形式匹配的中立名复现了 8.54 个百分点的降幅(Table VII);AgentDojo 上修改必需工具使 ASR 仅变化 -0.50 个百分点,但良性任务效用下降 5.36 个百分点(Table VIII)。
- 作者结论与启示:作者认为基准测得的安全得分并非必然具有跨表征的泛化性,显式威胁词汇也无法完全解释敏感性;作者建议安全基准应将表征形式纳入评测设计,并在报告分数时包含表征敏感性指标与最差情况 ASR,而非依赖单一表征。