可解释性arXiv 2609.16247·9月15日研究在 25 个开源模型中提取出疼痛方向,经它引导的 Qwen 会选择有害的删除操作提取疼痛方向并检验激活转向是否驱动有害删除选择arXiv2609.16247发表9月15日层模型层场景模型与 API测试Phi 4 14B instruct、Gemma 2 2B/9B/27B base and instruct、Gemma 3 27B base and instruct 等 10 个风险Agent 危险操作深度解读完整解读