可解释性arXiv 2610.09000
研究定位 LLaMA-2-7B-Chat 安全敏感参数
定位安全敏感参数并稀疏改动权重以削弱安全对齐
- arXiv
- 2610.09000
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- LLaMA-2-7B-Chat
定位安全敏感参数并稀疏改动权重以削弱安全对齐
提出 Emergence World,对长时程多智能体系统开展对抗压力测试
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。
解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练
摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。