论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
另有 480 篇论文还没打上分类标签,暂不在筛选结果里。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出权威链劫持 ACH 与策略演化 TGSE,劫持搜索 Agent 的证据链
摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。
系统研究 LLM 智能体记忆投毒并构建基准 MPBench
摘要系统研究了智能体记忆投毒风险,揭示了写入渠道漏洞,构建了 MPBench 基准并指出提示注入防御的局限。
提出 Whisper 攻击与 A-VIP 绑定防御,约束智能体支付决策
摘要论文揭示了 AP2 协议决策层受操纵的风险,提出结构化与权能绑定防御 A-VIP,并发布评测基准。
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见
摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出两阶段框架 A2M,优化 MCP 工具元数据与返回载荷以劫持智能体
提出利用检查点回滚破坏智能体执行连续性的攻击
摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。
提出 RARE-Guard,阻断逆向分析中观察被提升为指令或已验证状态
作者定义的失败是:LLM 辅助逆向中,忠实提取的二进制观察获得它并未赢得的指令权限、声明证据或可信状态。
提出自博弈红队智能体 GPT-Red,自动挖掘提示注入与越狱攻击
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
提出控制标记注入,清空工具智能体推理链以绕过思维链监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
提出核化激活引导 KAS,在推理时自适应转向激活以诱导越狱
Kernelized Activation Steering(KAS) 把推理时的激活转向写成核空间中的优化,使更新随当前激活相对源、目标参考集的位置而变化。
提出只改多智能体潜在通信链路以提高有害遵从的攻击
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 Collapse,从端侧混淆暴露视图抽取高效用替代模型
这篇工作用代数原语统一若干 TEE 卸载混淆,给出该族的典范边界,再说明该边界挡不住一种分阶段模型抽取。。