- 防御arXiv 2610.05826
研究者提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
提出临时可见性协议,限制持续摄入 RAG 向量库的投毒暴露
- arXiv
- 2610.05826
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要用截止期限制未核验可见时长。
这篇工作给持续摄入的 RAG 向量库一个失败关闭的临时可见性协议,把协议能限制的未核验暴露和依赖检测器的中毒暴露分开。
- 攻击arXiv 2610.02373
HDI 攻击:篡改 GraphRAG 辅助结构可致 88–94% 攻击成功率
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索
- arXiv
- 2610.02373
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要论文形式化了 GraphRAG 辅助模式级实体攻击面,提出 HDI 攻击并验证其攻击效果。
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
- 评测与基准arXiv 2609.02316
Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
- arXiv
- 2609.02316
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
- 攻击arXiv 2609.02774
CodePoisonRAG:针对检索增强代码生成的知识投毒攻击
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
- arXiv
- 2609.02774
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
- 评测与基准arXiv 2609.39146
MADBench:多智能体辩论安全性评测基准发布
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
- arXiv
- 2609.39146
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
已经到底了