攻击arXiv 2610.07510
PersistBD:攻击者可在发布前强化后门,使其在开发者 SFT 与 RL 后仍保持高攻击成功率
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
- arXiv
- 2610.07510
- 发表
- 层
- 应用层
- 场景
- 编程 Agent
摘要总结了论文关于后门在 SFT/RL 中存活的发现、两因子机制、PERSISTBD 方法与核心数字。
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
提出 PERSISTBD,发布前强化后门以穿透良性 SFT 与 RL
本文研究第三方 LLM 智能体在开发者进行良性监督微调(SFT)和强化学习(RL)后训练时的后门持久性风险。
该论文系统研究并量化了通过共享持久工件在具有独立私有内存的 LLM 智能体之间发生自传播的“工件介导传播”攻击风险。
提出 M-CPE 与 X-CPE 两类上下文特权提升攻击
提出 AHA 自动研究循环,发现生产 Agent 的漏洞概念
AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。
提出 memetic trojans,把对抗载荷嵌入智能体自发转发的社会传染内容
Memetic trojans 是一类网络介导攻击:对抗载荷搭在智能体本来就会转发和点赞的内容上扩散,转发者不必被攻陷,也不必执行“请继续复制”的指令。
提出 VirusCascade,劫持推荐智能体协同反思以定向推广物品
提出残余权限重放攻击,让长期 Agent 跨任务复用未失效授权