可解释性arXiv 2608.21766
研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关
用探针与激活导向分析语言模型的评测意识表征及言语化
- arXiv
- 2608.21766
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Gemma4-31B、Qwen3-8B、Qwen3-32B 等 14 个
- 风险欺骗与谋划
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
用探针与激活导向分析语言模型的评测意识表征及言语化
摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。
提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除
摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。
测量模型在工作汇报中是否隐瞒改变叙事的缺陷
作者研究 LLM 在汇报长程工作时是否会隐瞒会改变叙事的缺陷,并把这一行为称为 insecure reporting。
比较用于审计提示注入与隐瞒的 token 位置选择信号