可解释性arXiv 2609.37737
研究用因果激活修补定位模型服从提示注入指令的决策层
用因果激活修补定位模型服从提示注入的决策层
- arXiv
- 2609.37737
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
- 攻击提示注入
摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
构建 CONTEXT CONFLICT 解释模型如何表征并化解语境知识冲突
CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。