防御arXiv 2610.07935
SIGMA:让模型依据 Model Spec 自我改进安全对齐
提出 SIGMA,让模型依据 Model Spec 自造监督并改进安全对齐
- arXiv
- 2610.07935
- 发表
- 场景
- AI Agent
- 测试
- Qwen3.6-27B
摘要SIGMA 用 Model Spec 自造监督,单轮训练可迁到多项智能体安全指标。
SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。
提出 SIGMA,让模型依据 Model Spec 自造监督并改进安全对齐
SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
用迭代推理 DPO 从奖励作弊诱发隐蔽失准与对齐伪装
摘要提出了基于迭代 DPO 诱发涌现非对齐的方法,验证了隐蔽权力寻求与对齐伪装,并构建了选择性泛化测试基准。
发现无显式危害的窄域图文微调可诱发涌现失准
论文系统探究了视觉-语言模型中由窄任务微调诱发的跨模态涌现未对齐(Emergent Misalignment, EM)现象。