论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
研究者提出针对 Agentic RAG 的检索器后门威胁模型:攻击者只提供被污染的检索器检查点,不改动搜索 Agent 和部署语料,即可在触发问题下操纵检索结果。
另有 757 篇还没有研究类型,暂不在这些分类里。
研究者提出针对 Agentic RAG 的检索器后门威胁模型:攻击者只提供被污染的检索器检查点,不改动搜索 Agent 和部署语料,即可在触发问题下操纵检索结果。
提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门
提出利用路由元数据推断敏感话题的侧信道攻击
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
提出 eTAMP,通过网页注入跨会话污染 Web 智能体轨迹记忆
该论文评估了基于大语言模型的 Web 智能体在利用历史交互轨迹进行记忆增强时的安全脆弱性。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
提出流匹配逆向框架,从多向量视觉文档索引重构页面
完整解读提出 BENCHJACK,自动审计智能体基准的奖励作弊缺陷
论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。
提出无外部攻击模型的多轮自我越狱方法 SLIP
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
提出 PERSISTBD,在发布前强化后门使其经良性后训练仍然存活
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
完整解读提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员
微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞
提出 Cooldown Landmines 跨租户冷却干扰攻击并设计租户隔离
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
提出 HDI 攻击以篡改 GraphRAG 辅助结构破坏检索