可解释性arXiv 2610.09600
SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
- arXiv
- 2610.09600
- 发表
- 场景
- 模型与 API
- 测试
- Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出 TAME 框架,定位并验证驱动涌现失准的回复 token
摘要提出 TAME 框架在 token 粒度定位 EM 信号,掩码高归因 token 成功切断跨任务未对齐。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
用训练数据归因估计错误建议样本对涌现失准的贡献
EleutherAI 用训练数据归因考察错误建议微调中,哪些样本推动涌现失调。。窄域有害数据上的微调会使模型在无关问题上也给出有害回答。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
用物理陷阱模型描述 Best-of-N 越狱的攻击面规律
Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。