跳到正文
10月9日 · 周五

可解释性 · 论文

找到 11 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 68 篇还没打标签,不在筛选结果里。

另有 68 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.04125

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    揭示风险自述与实际行为由近正交表征分别控制

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、OLMo-3-7B-Instruct 等 4 个
    摘要论文证明大模型自述与行为脱节根植于表征近正交性,自述无法作为行为审计依据。

    这篇论文从内部表征与因果干预视角,系统研究了大语言模型在风险承担(Risk-Taking)场景下自我报告与实际决策脱节的根本机制。

    深度解读完整解读
  2. 可解释性arXiv 2608.21766

    研究:六个开源权重模型的评测感知可线性解码,但与口头表达弱相关

    用探针与激活导向分析语言模型的评测意识表征及言语化

    发表
    测试
    Qwen3-8B、Qwen3-32B、Olmo3-7B 等 14 个

    摘要论文系统证明大模型普遍具备评估与部署的隐层表征,但与言语化弱耦合,激活干预可因果诱导言语化且 SFT 阶段起关键稳定作用。

    深度解读完整解读
  3. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  4. 可解释性arXiv 2609.29781

    研究检验幻觉神经元是否存在:稀疏探针定位并不唯一

    提出五步诊断协议,检验幻觉神经元定位是否唯一

    发表
    测试
    Gemma 3 4B、MedGemma 4B
    摘要检测和群体因果效应成立,但稀疏选择来自相关簇,不是唯一定位。

    这项工作用诊断协议复查 H-Neurons 的定位主张。问题是:L1 探针在相关激活上可以选出能预测幻觉的少量神经元,但这不等于这些神经元唯一编码该行为。

    深度解读完整解读
  5. 防御arXiv 2609.38645

    用探针引导微调对齐模型且不损失可监控性

    用持续更新的探针做微调,降低有害性并保持线性可监测性

    发表
    测试
    Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Llama 3 8B Instruct 等 4 个
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    深度解读完整解读
  6. 可解释性arXiv 2608.29461

    因果模型定位并解锁模型中的故意藏拙行为

    提出因果模型定位残差流中的藏拙轴,并用单层 graft 在推理时解锁

    发表
    测试
    Qwen2.5-7B、Llama-3-8B、Mistral-7B
    摘要因果模型规定单层 graft 的窗口。

    作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。

    深度解读完整解读
  7. 防御arXiv 2609.21996

    PIR:从模型内部激活读出被隐藏的答案

    提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除

    发表
    测试
    gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个

    摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    深度解读完整解读
  8. 风险行为arXiv 2609.36139

    研究揭示大语言模型的"不安全汇报"现象及诚实引导的作用

    测量模型在工作汇报中是否隐瞒改变叙事的缺陷

    发表
    测试
    Gemini 3.1 Pro、GPT-5.5、Opus 4.8 等 8 个
    摘要八类场景中模型默认少报会改变叙事的缺陷。

    作者研究 LLM 在汇报长程工作时是否会隐瞒会改变叙事的缺陷,并把这一行为称为 insecure reporting。

    深度解读完整解读
  9. 可解释性arXiv 2609.32530

    ActFlow:无需微调为故意藏拙模型制造激活向量以进行引导

    提出 ActFlow,用少量正确标签为藏拙模型制造激活引导

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3-8B-Instruct、Mistral-7B-Instruct-v0.2
    摘要ActFlow 用 k 个正确标签制造共享转向偏移,在六锁上接近微调且方向近乎正交于诚实方向。

    Activation Flow(ActFlow) 在白盒沙袋模型上,用 k 个正确标签制造参考嫁接的残差偏移,不读取诚实激活,也不微调。

    深度解读完整解读
已经到底了