评测与基准arXiv 2610.08571
RAG-PIBench:可信 RAG 系统中提示注入检测的泄漏感知基准
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
- arXiv
- 2610.08571
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 被测模型
- DistilBERT-base-uncased、DeBERTa-v3-base、MiniLM
提出 RAG-PIBench,评测 RAG 上下文中提示注入检测器
用配对回放评测任务范围授权能否阻断越权工具执行
提出 NDDL,用良性扩散轨迹检测文生图后门提示并定位触发 token
NDDL 是面向文生图扩散模型的后门防御:防御者只有白盒模型访问和良性提示词,没有后门先验,需要区分后门提示词并找出触发 token。
提出 ToolFence,以能力蓝图和确定性授权拦截 Agent 未授权工具调用
提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复
Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。
用任务绑定令牌和策略预言机拦住多智能体流水线的未授权执行
作者在一条会改写沙箱邮件库的四智能体流水线上,检查低权限失陷会不会变成未授权的真实动作。
提出神经符号纵深架构,阻断 AI-SOC 的日志投毒与间接提示注入
提出 FedMAST,用多轴结构痕迹检测并遏制联邦学习后门
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
提出类型化溯源与断言护栏,约束持久 Agent 释放自传断言
提出 AMS,用激活分离与方向相似度检测安全训练改动
AMS 是面向开放权重模型、部署前使用的激活扫描器,用来看安全训练被拿掉或改写之后,激活空间里还留着什么几何痕迹。
提出策略 RAG 的知识库投毒攻击与检测防御 CLD-KB