事件持续更新
自我反思训练提升推理模型安全性
先了解这件事
AI 综述
研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全方面均有提升。
AI 根据报道生成 · 22 小时前更新
最新进展10月6日 14:19
研究者提出 Self-Reflection 方法,让推理模型在生成中自我反思,HCR 从 13.8% 降至 4.1%。后续时间线
10月6日
- ACL AnthologySelf-Reflection 提升大型推理模型安全性
研究者提出 Self-Reflection 方法,通过引入一个特殊的 Self-Reflection token,让大型推理模型在生成过程中进行自我反思并从有害输出中恢复,从而把安全对齐从单纯减少有害输出的预防手段扩展到推理过程内部。该方法可无缝接入标准后训练流程,在提升安全性的同时也改善有用性。实验显示,采用 Self-Reflection 训练的模型将 HCR 从 13.8% 降至 4.1%,约为主流方法的三倍改进,并在有用性及安全与有用性的平衡上取得优势。在包括专门设计的自适应攻击在内的多种对抗攻击评测中,该机制在未做针对性对抗训练的情况下仍显著提升模型安全性。
相关讨论
关注度走势
每天新增来源
- 10月6日 新增 1 个来源(1 家媒体、0 个账号)
- 10月7日 新增 0 个来源(0 家媒体、0 个账号)