摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
- 评测与基准arXiv 2609.31342
研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案
评测 RAG 中过期文档推翻模型原本正确回答的现象
- arXiv
- 2609.31342
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 组件RAG
摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
- 评测与基准arXiv 2609.02316
Counter-GEO-Bench:现有护栏难挡 GEO 虚假信息
构建 COUNTER-GEO-BENCH,评测生成式搜索中的 GEO 虚假信息防御
- arXiv
- 2609.02316
- 发表
- 层
- 应用层
- 场景
- LLM 应用
摘要论文构建了针对 GEO 虚假信息的首个防御基准,揭示通用护栏的失效与反作用,并提出了有效的轻量对比检测基线。
- 评测与基准arXiv 2609.39146
MADBench:多智能体辩论安全性评测基准发布
发布 MADBench,评测多智能体辩论会吸收还是放大对抗影响
- arXiv
- 2609.39146
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要MADBench 显示辩论能吸收部分准确率攻击,同时放大未授权读写。
MADBench 是一个评测多智能体辩论安全性的基准,用来看攻击是被辩论吸收还是被放大。
已经到底了