可解释性arXiv 2609.30326
Qwen3.5-0.8B 关停响应的受控梯度激活引导:一种最小步数策略
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
- arXiv
- 2609.30326
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 被测模型
- Qwen3.5-0.8B
提出有守卫最小步激活引导,只在关机语境把继续偏好转向接受关机
在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大
作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。
提出 influence score,量化提示注入检测器各注意力头的有效贡献
这项工作在推理时给提示注入检测分类器的注意力头一个影响分数,用来看分类决策从哪些头来。缺口是电路分析往往要重插桩,只看输出又不知道内部组件的贡献。作者希望同时看到决策在哪一层形成、哪些头在推,以及正确与错误是否对应不同机制。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出 MonoTM,用 SAE 单义特征估计文档主题混合并生成主题描述
MonoTM 是建在文档嵌入 SAE 上的可解释主题模型:混合估计用全部 SAE 特征,主题描述只用另一套配置里通过验证的语义特征。