研究揭示过期文档投毒:RAG 检索可让模型放弃原本正确的答案
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
- arXiv
- 2609.31342
- 发表
- 层
- 应用层
- 场景
- LLM 应用
- 测试
- Llama-3.1-8B、Llama-3.1-70B、GPT-4o 等 13 个
- 组件RAG
摘要论文评测了陈旧检索推翻正确知识的中毒现象,并分析了其内部机制与防御局限。
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
另有 284 篇论文还没打上分类标签,暂不在筛选结果里。
构建知识逆转基准,评测陈旧检索证据如何推翻模型原本正确的回答
这篇论文是对检索增强生成(RAG)中“陈旧文档中毒”现象的实证与机理评估研究。
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 CodePoisonRAG,对检索增强代码生成的知识库投毒以植入漏洞
摘要CodePoisonRAG 展示了 RACG 外部知识库的新攻击面,在较低投毒率下可定向诱发指定漏洞并部分抵御防御。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出 ISM,协同改写技能描述与提示词以隐式操纵技能选择
提出 FAME,用反事实概念漂移评测智能体虚假记忆
FAME 是一个免训练的评测框架,用来判断自主智能体的记忆在虚假相关、环境偏移或知识冲突下是否已变成虚假记忆。。
提出 DERIVAUDIT,审计长期 Agent 记忆是否由交互历史支持
DERIVAUDIT 审计长期智能体的持久记忆是否由写入时可获得的交互历史支持,而不是只看以后能否被召回。
提出 LongPIBench,评测长文档场景下的提示注入攻击与防御
摘要论文构建长文本提示注入基准 LongPIBench,揭示启发式与优化攻击在长文档中的高有效性及现有防御的大幅失效。
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入