防御arXiv 2609.28239
ODPure:通过集成破坏共识实现目标检测后门净化
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
- arXiv
- 2609.28239
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- YOLOv5、Faster R-CNN
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出针对 Agent Harness 的上下文特权提升攻击
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出 TC-UAP,用身份级多帧扰动保护视频免被定制复现身份
作者要解决的是:发布前如何给视频加不可见扰动,使片段既不能被拿去微调视频扩散模型,也不能被抽帧做 image-to-video。