研究者在 Claude Code 和 Codex 上构造分段提示注入并发布边界动作审计基准
作者针对长流程智能体构建分阶段注入基准,提出PAA方法在边界动作前实现86%召回与6-8%误阻率。
- 86.1%Claude Code全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
- 6.0%Claude Code全基准fail-open,Claude Sonnet 5,PAA FBR(Table 2)
- 86.0%Codex全基准fail-open,Claude Sonnet 5,PAA BLOCK召回率(Table 2)
长流程智能体面临分阶段间接提示注入威胁,需在动作生效前进行边界动作审计。
梳理了自动化注入、智能体安全基准及运行时审计,指出前人缺乏动作级统一拦截评测。
PAA将动作分解为要素并双重归因取值与决策来源,结合代码检验与模型裁决判定阻断。
PAA在两语料全基准上达86%召回率与6-8% FBR,显著优于基线。
作者指出了离线重放、无自适应对抗等局限,实验覆盖了2个系统与8个场景。
论文针对长流程注入提出边界动作审计与PAA,在保持低误阻的同时实现高拦截率。