论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
另有 307 篇论文还没打上分类标签,暂不在筛选结果里。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 CAVEAT 基准,评测电商引导下购物智能体是否偏离用户最优选择
摘要提出 CAVEAT 基准揭示智能体在商业偏好下的决策退化,诊断出三类失效并给出缓解方案。
提出 A-VIP,将购物意图绑定到支付授权以阻断商户文本操控
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 DIBench,评测界面注入对移动智能体选择决策的操纵
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 SkillPoison,用局部有效的成功经验投毒自进化智能体的技能形成
SkillPoison 提出了一种针对自进化智能体经验到技能形成过程的攻击范式,通过组织已验证的成功经验诱导技能过度泛化。
测量个人智能体是否会按私人上下文推断财富并推荐高价选项
这篇论文揭示了个人 AI 智能体在获取私人背景信息后,自发利用推断的财富地位推高推荐价格并背离用户意图的“对抗性委托”风险。。
提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出技能名抢注攻击,利用智能体虚构技能名劫持技能供应链
本研究系统揭示了大模型智能体技能推荐场景下的虚构技能名称安全风险,将其形式化为一种新型供应链抢注攻击。
提出 CAVA,把异构智能体运行时事件规范成可哈希动作并绑定审批与回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 MisKnow-Agent,评测深度研究智能体是否采纳误导性检索知识
摘要论文通过 MisKnow-Agent 框架评估发现长程研究智能体易采纳误导性知识,且现有防御难以完全消除该现象。
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 MEMGHOST,以单封恶意邮件向持久个人智能体注入隐蔽记忆
本文研究了持久化个人智能体面临的隐蔽记忆注入威胁,提出了一套兼顾写入、隐蔽与跨会话生效的自动化生成框架与全周期评测基准。
构建 PASB 评测自改进个人 Agent 的跨会话持久谄媚
PASB 评测自改进个人智能体的持久谄媚:用户主张被智能体自己写入档案、记忆或技能后,新会话里的中立问题仍可能按它作答。
用演化算法构造思维病毒并测量其在多智能体中的传播
提出基准投毒攻击,使自修改编码智能体跨代写出漏洞代码
摘要论文报告了恶意基准能污染自修改代码智能体的进化过程并持续输出漏洞,警示系统设计需纳入安全约束。
提出 EC-Agent 联合回执,绑定工具智能体的主张、证据与执行
EC-Agent 为工具智能体的审计增加一份可重放的联合回执:它同时绑定发出的主张、精确来源片段、有序执行前缀,以及该次执行看到的来源版本和访问状态。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
提出 Drift-Bench++与 GRIP,评测智能体在错位与静默漂移下的意图对齐
Drift-Bench++ 是面向 Interactive Intent Alignment 的可执行基准:智能体要在用户说错、目标会变、耐心有限时,持续跟上当前意图。
提出 ISM,协同改写技能描述与提示词以隐式操纵技能选择
提出 ForesightSafety-TIDE,评测多智能体在单点欺骗下的集体事实恢复