防御arXiv 2608.02683
S³:用多阶段防御提升 LLM 智能体安全
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
- arXiv
- 2608.02683
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- DeepSeek-V4-Pro、DeepSeek-V4-Flash
- 防御监控与审计
- 攻击投毒与后门
- 风险Agent 危险操作
- 组件监控器
另有 479 篇论文还没打上分类标签,暂不在筛选结果里。
提出 S³ 多阶段防御,由 guard agent 编排阶段安全技能检测并缓解风险
提出 RACER,用区域感知一致性对抗微调去除多模态大模型后门
提出 GhostWord 词级触发后门,对自动语音识别做数据投毒
提出 TRIM,在黑盒推理时定位并净化图像后门区域
提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本
面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。
提出 FreqDoor,在频域混合振幅并对生成式 VLM 做训练时视觉后门
FreqDoor 是针对生成式 VLM 的仅视觉、训练时后门:在频域混合触发源振幅、保留干净图像相位,使触发在空间上分散。
提出 ODPure,在输入阶段用腐蚀重建与共识净化目标检测后门
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。