研究:内部探针何时优于读答案,区分阈值失准与行为隐藏知识
用探针与 logit margin 区分阈值失准与行为隐藏知识
- arXiv
- 2609.04582
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Phi-3.5-mini、Qwen3-0.6B、Qwen3-1.7B 等 8 个
摘要验证里结论多在 logit、丢在阈值。
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
用探针与 logit margin 区分阈值失准与行为隐藏知识
这项工作问内部探针何时比直接读答案更有信息,并在验证任务里把落差定位到读出阈值。
提取疼痛方向并检验激活转向是否驱动有害删除选择
用 SAE 比较状态空间模型与 Transformer 的中层潜在概念
检验词性在 SAE 潜空间是单特征还是紧凑组编码
Bondielli、Passaro、Auriemma 和 Lenci 用词性检验 SAE latent 如何组织形态句法信息。。
用激活修补定位并验证多语模型首 token 语言身份电路
六个不超过 2.8B 的多语模型上,第一个生成 token 的语言身份被抽成经过精确修补验证的注意力电路。。
比较激活值与梯度定向特征的检测和干预效果
作者比较假设驱动的定向特征学习:为预先指定概念构造单一特征,并同时看检测与因果干预。CAA 与 GRADIEND 原先同时改变信号和估计器。本文将 activation value、activation gradient、parameter gradient 与 contrastive mean、IEND 交叉,补齐 ACTIEND、AGIEND、CAGA、CGA,并以预训练 SAE 为非定向参照。
提出 REGEXROUTE,用 SAE 引导的正则特征做 LLM 路由
提出 effective interference,分析 SAE 架构如何塑造已实现特征干扰
Costa 与 Tolooshams 把概念提取中的干扰从纯几何改写成几何与 code 统计的联合量,并说明 SAE 架构决定这些交互被抵消还是被保留。。
测量系统提示词对模型逐层计算的重构程度
摘要系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。
揭示相邻 Transformer 层相互抵消残差写入的 TLCM
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
提出 SAKIKO 框架,审计工具调用 LLM 的定向激活干预是否构成修复
SAKIKO 审计工具型 LLM 在执行前 K 路动作上的内部干预:行为净增益、到达正确动作、保住原本正确的决策、以及统计证据充分,是四件分开的事。
用因果激活修补定位模型服从提示注入的决策层
这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。