可解释性arXiv 2608.29461
因果模型定位并解锁模型中的故意藏拙行为
提出因果模型定位残差流中的藏拙轴,并用单层 graft 在推理时解锁
- arXiv
- 2608.29461
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen2.5-7B、Llama-3-8B、Mistral-7B
- 风险欺骗与谋划
摘要因果模型规定单层 graft 的窗口。
作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。