论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
研究者提出 VerTox,首个把语料投毒形式化为可验证奖励引导强化学习(RLVR)问题的框架,通过专门的奖励塑形把排序扭曲与事实污染耦合起来,将小型 LLM 微调为对抗文档生成器。
研究者提出 DiscourseFlip,一种针对黑盒检索增强生成(RAG)系统的话语级观点操纵攻击。
清华大学与鹏城实验室等机构的研究者提出 Vision-Centric Jailbreak Attack(VJA),一种把恶意编辑指令完全嵌入图像视觉提示、不依赖文本输入的视觉到视觉越狱攻击,并构建了面向图像编辑模型的安全基准 IESBench。
研究者提出 SWhisper,一个在商品级扬声器和麦克风条件下对语音驱动 LLM 实施隐蔽提示注入与越狱的框架。
研究者提出 MAStrike,一个针对分层多智能体系统(MAS)的闭环协同红队框架,通过智能体级 Shapley 值分析量化每个智能体对系统鲁棒性的边际贡献,据此识别脆弱智能体联盟并生成角色感知的协同对抗操纵。
研究者提出 Prometheus,一种免训练、基于搜索的提示词窃取攻击,通过与本地代理模型交互逆向还原文生图作品的提示词。
哈尔滨工程大学、山东大学与西安电子科技大学的研究者提出 Adversarial Style Optimization(ASO),一个即插即用的增强模块,用于放大现有多模态越狱攻击。
论文重新审视真实多阶段 RAG 流水线下的语料库投毒攻击,发现许多现有攻击在重排序后效果大幅下降,尽管其在检索阶段仍保持高相关性。
研究者提出一种名为 Visual Memory Injection(VMI)的隐蔽攻击,针对生成式大型视觉语言模型(LVLM)在多轮长上下文场景下的安全弱点。
研究者提出 DITTO,一个在黑盒条件下伪造水印 LLM 作者归属的攻击框架,让恶意模型生成的文本被检测器误判为来自可信的目标模型,从而把虚假信息嫁祸给可信来源。
研究者发现扩散大语言模型(DLLM)的安全对齐同样集中在稀疏的安全神经元上,且从自回归模型初始化而来的 DLLM 会继承源模型的安全机制,可通过直接映射并剪枝这些神经元实施跨架构迁移攻击。
研究者提出 VidDoS,一个面向 Video-LLM 的通用能耗延迟攻击(ELA)框架,通过通用优化生成与实例无关的触发器,无需在推理时计算梯度。
论文指出多智能体 LLM 流水线缺少跨智能体边界的验证机制,一旦某个智能体接受对抗内容,该内容会作为可信输入在整条流水线中传播。
研究者针对多模态大模型提出基于意图混淆的越狱攻击分析框架,指出这类攻击受重构与隐藏权衡支配:变换后的输入既要躲过安全过滤器,又要让受害模型能还原原始请求。
研究者提出 SlotGCG,通过在全提示词范围内搜索对抗 token 的插入位置来提升越狱攻击效果。
研究者提出 UNIATTACK,一个从防御视角出发、系统构造黑盒攻击提示词的对抗测试框架。