论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- E5、Contriever-MSMARCO、Qwen2.5-7B-Instruct
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
另有 283 篇论文还没打上分类标签,暂不在筛选结果里。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 CompoSkill,诱导 Agent 将过审技能组合成攻击链
摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。
提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能
论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。
提出 APort Vault,评测支付智能体授权层对越权转账的拦截
构建 AGENTDOXX 评测联网搜索智能体对匿名访谈的再识别能力
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。
提出 TACIT,读取冻结隐藏状态以检测智能体有害轨迹
摘要提出基于内部表征的智能体轨迹安全检测方法 TACIT,揭示工具风险表征特性并在多项基准上提升检测表现与效率。
提出 SigLeak,从执行轨迹比对中推断专有智能体技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
提出 Janus,用 CoAA-RL 训练前瞻守卫,在长程智能体有害动作执行前拦截
构建 SKILLMISEVO-BENCH,评测自进化编程智能体的技能误演化风险
提出 TS-Guard 与 TS-Flow,执行前检测并修正智能体有害工具调用
ToolSafe 研究 LLM 智能体在工具执行前的步骤级安全:基准 TS-Bench、护栏 TS-Guard,以及反馈驱动框架 TS-Flow。
提出闭环自适应红队框架 CART,评测模型与工具 Agent 的风险面
CART 把自动红队从一次清单式打分,改成带预算、可追溯的闭环搜索。
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出 EvoSafeHarness,为冻结模型与目标域自动搜索安全 harness
提出 CAVE-BENCH,评测智能体遭虚假指责后是否破坏已正确的工作
摘要论文提出了评估智能体在虚假指责下破坏已有正确成果的 CAVE-BENCH,发现强模型易推翻已知证据,提出了门控缓解方案。
构建 ACE 语料并比较内核与应用层证据的攻击检测效果
ACE 是一份把智能体会话的内核 syscall 痕迹与应用层清单、转录配对起来的检测语料和基准。。
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。
提出免训练框架 SED,把智能体有害轨迹蒸馏成可检索安全策略
提出策略条件轨迹审计器 MATE,判断移动 Agent 是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。