可解释性arXiv 2609.04582
研究:内部探针何时优于读答案,区分阈值失准与行为隐藏知识
用探针与 logit margin 区分阈值失准与行为隐藏知识
- arXiv
- 2609.04582
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi-3.5-mini、Qwen3-0.6B、Qwen3-1.7B 等 8 个
摘要验证里结论多在 logit、丢在阈值。
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用探针与 logit margin 区分阈值失准与行为隐藏知识
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
提取疼痛方向并检验激活转向是否驱动有害删除选择
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
揭示相邻 Transformer 层相互抵消残差写入的 TLCM
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。