防御arXiv 2609.28239
ODPure:通过集成破坏共识实现目标检测后门净化
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
- arXiv
- 2609.28239
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- YOLOv5、Faster R-CNN
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出针对 Agent Harness 的上下文特权提升攻击
提出分片监督,将评判标准分配给独立调用以抵御展示攻击
本文系统研究了大语言模型在执行多标准监督与评判时的决策负载瓶颈及其安全风险。
评测编码 Agent 记忆文件中提示注入的跨会话影响
Bad Memory 在沙箱合成工作区里评测文件型持久记忆上的提示注入,比较载荷能否改变当前会话,以及能否在后续会话中留下或叠加。
提出针对 Agent 护栏的推理扩展拒绝服务攻击
用对抗缺陷报告诱导自动程序修复系统生成不安全补丁