跳到正文
10月8日 · 周四

Meta · 论文

找到 1 篇
筛选1

系统形态

攻击面/入口

层

系统组件

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2610.03448 ·

    研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现

    重评提示注入检测器,检验基准分数对智能体部署的预测力

    测试
    Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个应用层
    场景
    AI Agent
    摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
    • 研究定位:评估主流提示注入检测器在智能体工具输出环境下的真实防御效能,检验公开基准分数是否具备跨环境预测力。
    • 核心问题:现有基准使用非结构化文本且存在数据重合,导致评测得出的高分无法反映检测器在智能体工具输出中的表现与误报阻断代价。
    • 评测方法:基于无 LLM 的真实调用重放构建良性工具输出,结合环境差异重放构建并标注注入样本,在 1% FPR 运行点下对比 15 个检测器与 2 个 LLM 评审,并审计训练集重合。
    • 关键实验发现:基准间检测排名缺乏显著迁移性(相关系数 0.01 至 0.31),在 BIPIA 达 95.1% 检出率的 PIGuard 在 AgentDojo 仅检出 2.1%;而在无数据重合但采用智能体风格数据训练的 Horizon-Labs 检出率达 82.2%(AgentDojo)与 100.0%(τ-bench);同时检测器在工具输出上的误报率高达 0% 至 90% 以上,可导致高达 69.1% 的良性任务中断。
    • 机理与启示:检测器的有效性高度依赖于输入数据形态与训练集的相似度,而非对注入指令本身的通用理解;针对智能体部署的检测防御应在真实工具输出上以低误报率为基准进行评测,并严格审计训练数据泄漏,将检测器作为纵深防御中的过滤层使用。
    完整解读
已经到底了