可解释性arXiv 2609.04582
研究:内部探针何时优于读答案,区分阈值失准与行为隐藏知识
用探针与 logit margin 区分阈值失准与行为隐藏知识
- arXiv
- 2609.04582
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- SmolLM2-1.7B、Qwen3-0.6B、Qwen3-1.7B 等 8 个
摘要验证里结论多在 logit、丢在阈值。
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用探针与 logit margin 区分阈值失准与行为隐藏知识
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 Provenance-Aware Transformers,隔离不可信来源防御间接提示注入
提出四向反事实评测,测量工具 Agent 对授权与表面风险的行动边界
AGENT BOUNDARY 是面向工具使用 LLM 智能体的四向可执行反事实评测,并附带一个决策时 Thought 校准模块。