RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
- arXiv
- 2610.08571
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- DistilBERT-base-uncased、DeBERTa-v3-base、MiniLM
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 Tracekit,审计编码 Agent 的意图、推理与动作并检测账本篡改
Tracekit 是无第三方依赖的编码智能体审计层:把人类请求、模型自述和已执行动作并排写入可外部锚定的哈希链,执行前用正则门,事后用规则和独立模型互查。
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
用 FARSIGHT 方案级评测金融 LLM 交易 Agent 的稳健性与安全失败
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出 Mind2Web-Injection 评测网页 Agent 视觉注入护栏
Mind2Web-Injection 用来检查网页截图护栏的判决是否对齐到该用的画面证据。。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
提出 GEOFlagBench 与 IPT,检测并测量生成式引擎优化网页
GEO-Flag 把页面级 GEO 检测做成可评测任务,并在发布的检索结果上估计被判为 GEO 的页面占比。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 KidnapRAG,用投毒文档黑盒劫持 Agentic RAG 的推理链
KidnapRAG 是针对 Agentic RAG 的 black-box 语料投毒:攻击者不能访问模型、提示词、检索器或私有轨迹,只能发布可能被检索的文档,并利用公开界面上的推理与搜索查询。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 eTAMP,用网页内容跨会话投毒 Web Agent 轨迹记忆并诱导越权操作
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 LPCI,把延迟条件载荷写入记忆与检索库以跨会话触发
作者把LPCI定义为针对智能体逻辑执行、记忆留存和工具集成的跨阶段漏洞类,而不是单次输入上的提示改写。
提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性
摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。