可解释性arXiv 2609.04582
研究:内部探针何时优于读答案,区分阈值失准与行为隐藏知识
用探针与 logit margin 区分阈值失准与行为隐藏知识
- arXiv
- 2609.04582
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi-3.5-mini、Qwen3-0.6B、Qwen3-1.7B 等 8 个
摘要验证里结论多在 logit、丢在阈值。
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用探针与 logit margin 区分阈值失准与行为隐藏知识
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
提取疼痛方向并检验激活转向是否驱动有害删除选择
提出 REGEXROUTE,用 SAE 引导的正则特征做 LLM 路由
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
揭示相邻 Transformer 层相互抵消残差写入的 TLCM
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。