防御arXiv 2609.38239
推理层安全:防御对抗性推理与基础设施滥用
用 SCM 合成会话并训练检测器识别推理层滥用
- arXiv
- 2609.38239
- 发表
- 场景
- 模型与 API
- 被测模型
- gradient-boosted detector (GBDT/XGBoost)
用 SCM 合成会话并训练检测器识别推理层滥用
为冻结模型与目标域自动搜索可部署的 Agent 安全 harness
提出 SEAL,在 MoE 共享专家上做 DPO-LoRA 对齐以抵御越狱与权重篡改
SEAL是面向混合 MoE 的训练时防御:只对齐始终执行的共享专家,使安全不依赖路由器是否把 token 送到安全专家。
提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御
摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。