论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
另有 516 篇论文还没打上分类标签,暂不在筛选结果里。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统
这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。
提出工作流级越狱构建,经多轮开发工作流诱导编程 Agent 在代码中写出有害内容
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 OTTER 词元替换越狱,绕过表面毒性审核诱导有害回答
摘要论文展示了表面毒性与恶意意图的解耦现象,通过标准 API 实现黑盒越狱测试,并提出闭环分类器加固建议。
提出 LogInject 框架,评测日志分析中的被动提示注入及缓解
摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
提出无外部攻击模型的多轮自我越狱方法 SLIP
摘要论文提出了无外部攻击模型的自我越狱方法 SLIP,指出对齐模型内在能力抑制的漏洞并设计了语义漂移防御。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
用 StegoMemory 测试智能体持久记忆作为跨会话隐写信道的可行性
摘要研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。
提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
提出跨通道分段攻击,利用 MCP 隐式信任诱导外发敏感文件
摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 CFD,跨会话拆解有害目标以绕过工具智能体本地监控
CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。
提出 TRACE,用任务分解与可演化多轮策略诱导编程智能体执行有害工作流
提出数据伪造攻击,使密码学模型认证在审计集通过但部署失效
这篇工作同时给出对 CMC 的数据伪造攻击,以及先承诺、后抽样的认证模板。。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。