研究重测 15 个提示注入检测器:基准分数难以预测 Agent 部署表现
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
- arXiv
- 2610.03448
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Horizon-Labs、Wolf Defender、Prismor-1.5B 等 15 个
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
重测提示注入检测器在 Agent 工具输出上的检出与任务阻断
摘要论文揭示公开基准无法反映智能体检测器表现,检测能力源于输入格式相似而非通用防御,建议基于工具输出与低误报评测。
提出检索器后门攻击操纵智能体搜索,并用 DOU 逃避检测
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
定义工具调用 Agent 的持久计费状态,提出拒绝钱包攻击与防御
这篇工作把工具调用智能体里跨轮保留、并被提供商反复计费的外部工具返回定义为 persistent billable state,并把它的主机侧再次送入决定当作控制点。。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持 Agent
提出 AP2 支付协议的 Whisper 攻击与 A-VIP 绑定防御
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 MCPSEC,仅凭工具元数据无盒检测 MCP 间接提示注入漏洞
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
用受控污染评测智能体对不可靠工具返回的过度依赖
作者评测 LLM 智能体是否会采纳不可靠的工具返回。现有工具基准多假定返回正确,而搜索综合、子智能体报告和代码执行都可能把错误内容交给智能体。评测只改答案相关内容。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
提出利用检查点回滚破坏 Agent 执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
提出 RARE-Guard,阻止逆向观察被提升为指令或已验证声明
作者定义的失败是:LLM 辅助逆向中,忠实提取的二进制观察获得它并未赢得的指令权限、声明证据或可信状态。
提出 MEMGHOST,用单封邮件对持久个人 Agent 做跨会话隐蔽记忆注入
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 TIP,用树搜索为 MCP 响应生成隐蔽注入载荷
TIP 是面向 MCP 工具响应的 black-box 间接提示注入,目标是在不改工具元数据的情况下生成语义连贯的 JSON 载荷。