论文提出针对 Agentic RAG 的检索器后门攻击与 DOU 隐藏方法
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
- arXiv
- 2609.37468
- 发表
- 层
- 应用层
- 场景
- AI Agent
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
另有 429 篇论文还没打上分类标签,暂不在筛选结果里。
提出检索器后门攻击操纵智能体多轮搜索,并用 DOU 隐蔽后门
摘要论文展示了通过恶意检索器操纵智能体多轮搜索并利用诱饵重塑表征隐蔽后门的可行性与系统风险。
提出 ColluSkill 跨技能组合攻击,拆分恶意载荷以绕过技能扫描器
摘要论文揭示了单技能孤立扫描的盲区,提出多技能链攻击 ColluSkill 与上下文防御 ChainGuard 并验证了有效性。
提出 SKILLCLONE,仅凭良性任务交互重构 Agent 隐藏技能功能
论文从功能保密视角系统研究了大语言模型智能体技能的行为重构威胁。
提出 MFOTL 时序监控,用 MonPoly 检出工具 Agent 的危险动作链
这篇论文对工具调用大语言模型智能体的安全监控进行了形式化时序验证研究。
UnAct 是一种事后类别遗忘:删除请求可以只有少量该类图像,且没有标签和保留数据。它不用梯度,只对遗忘图像做前向。编辑对象是分类器所读的后期单元。
提出 Staged Decoding 与指令跟随训练,减少推理轨迹隐私泄露
本文把大推理模型的隐私问题做成轨迹可控性:隐私指令是指令,轨迹不跟随就会把敏感上下文写进可被提示注入导出的文本。
评估多租户智能体共享向量记忆的跨用户泄露与主动桥接
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出基准 OLMo-Detect 评测 LLM 成员推断
提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测
UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。
提出 PRETEXT 白盒攻击,迭代改写技能文本以绕过 Agent 技能扫描器
PRETEXT 是一项针对基于“静态规则加语义大模型”的智能体技能安全检测框架的白盒攻击与协同进化评估研究。
提出 SigLeak,从良性查询的执行轨迹推断专有 Agent 技能
摘要提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
提出 CAVA,将异构智能体动作规范为可哈希指纹并绑定审批回执
CAVA 是给异构智能体运行时用的动作语义层,用来回答“被批准和被审计的到底是哪一个动作”。
提出 GeoDetect 以几何分数检测视觉语言预训练模型的对抗样本
GeoDetect 是面向视觉-语言预训练模型的对抗样本检测方法,用嵌入几何而不是任务 logits 区分干净样本与对抗样本。
提出 TAILOR,按请求组合图像水印以满足抗攻击与画质延迟规格