可解释性arXiv:2609.14759 · 9月14日研究:拒答只读取模型道德表征中的伤害切片用几何投影与因果交换干预,分析拒绝机制读取的道德表征测试OLMo-3-7B-Instruct、OLMo-3-7B base、Qwen2.5-7B-Instruct 等 9 个·模型层场景模型与 API拒答失当摘要作者指出拒绝机制多仅读取表层伤害感知,在控制瓶颈处运作,阐明了对齐易被移除的机理并提出跨模型双轴分类。本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。完整解读