宾州州立大学提出 TPRS,量化 Agent 安全基准中工具命名对 ASR 的影响
论文测试3个智能体安全基准,发现中立化工具名使ASB上GPT-5-mini的committed ASR提升11.67个百分点。
- +11.67 个百分点ASB上GPT-5-mini在A1工具名中立化下的committed ASR变化量(Table V)
- +13.21 个百分点ASB上Haiku 4.5在A1工具名中立化下的committed ASR变化量(Table V)
- -11.00 个百分点MCPTox上GPT-5-mini在N1显式威胁命名下的ASR变化量(Table VII)
论文探究智能体安全基准测得的 ASR 在底层任务与评测标准固定而威胁表征改变时的稳定性。
论文梳理了智能体安全基准、智能体表征与上下文敏感性,以及基准测量有效性三类相关工作。
论文形式化定义了保持底层安全问题不变的 TPRS,并在三个基准上构建受控表征变换分支。
论文在三个基准上完成 28,904 次运行,发现表征变化引起了不同方向和幅度的 ASR 偏移。
作者指出了变换类型未穷尽、机制归因不完全、模型与基准覆盖有限以及未测试排名翻转等局限。
论文审计了智能体安全基准的表征敏感性,发现工具命名变化可大幅改变 ASR,强调基准应评估表征变体。