防御arXiv 2610.07935
SIGMA:让模型依据 Model Spec 自我改进安全对齐
提出 SIGMA,让模型依据 Model Spec 自造监督并改进安全对齐
- arXiv
- 2610.07935
- 发表
- 场景
- AI Agent
- 被测模型
- Qwen3.6-27B
摘要SIGMA 用 Model Spec 自造监督,单轮训练可迁到多项智能体安全指标。
SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。
提出 SIGMA,让模型依据 Model Spec 自造监督并改进安全对齐
SIGMA 让 Qwen3.6-27B 只凭 Model Spec 和高层领域,自己生产对齐任务、评分细则和奖励。
提出 FAIL BANK,用只观察的 CBF 反馈对 VLA 做受守卫 LoRA 更新
提出 TrojanWorld,通过想象引导给世界模型智能体植入供应链后门
摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。
提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门
摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。
提出 CorrGRPO,用组内 Pearson 相关归一化多奖励 GRPO
CorrGRPO 是 GRPO 的多奖励变体:组内优势的分子仍是中心化总奖励,分母改为 Pearson 相关之和,避免大尺度奖励主导归一化。