可解释性arXiv 2609.23587
大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
- arXiv
- 2609.23587
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响
作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。
用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地
这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆