防御arXiv 2608.21500
SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
- arXiv
- 2608.21500
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 AnchorRep,用表征排斥防御跨模型越狱迁移