可解释性arXiv 2609.14759
研究:拒答只读取模型道德表征中的伤害切片
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
- arXiv
- 2609.14759
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、OLMo-3-7B-Instruct 等 9 个
- 风险拒答失当
摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。