分析与理论arXiv 2609.30802
研究:知识蒸馏中 chat 模板会削弱学生模型的安全对齐
分析良性知识蒸馏中提示模板对学生拒答保留的影响
- arXiv
- 2609.30802
- 发表
- 场景
- 模型与 API
- 测试
- Gemma-2-9B-IT、Gemma-2-2B-IT、LLaMA-3.1-8B-Instruct 等 7 个
- 风险拒答失当
分析良性知识蒸馏中提示模板对学生拒答保留的影响
用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
测绘去安全开源模型的生产、重分发与下游应用留存机制
摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。