跳到正文
10月9日 · 周五

可解释性 · 论文

找到 12 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 101 篇还没打标签,不在筛选结果里。

另有 101 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验监控器低读数能否作为代码奖励作弊已受控的证据

    发表
    测试
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  2. 分析与理论arXiv 2609.37312

    研究:隐蔽推理必然留下信息痕迹,但思维链未必可读

    分析隐蔽推理在思维链监控下的信息足迹下界与不可读性

    发表
    测试
    Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个

    摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。

    深度解读完整解读
  3. 可解释性arXiv 2610.01864

    从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念

    提出多 SAE 对齐方法,从音乐模型表征中发现和弦与调性轨道

    发表
    测试
    MuQ、MusicFM
    摘要用移调对齐的多 SAE 恢复和弦、调与旋律轨道,并用少量锚点做下游音乐理解。

    作者提出一套面向音乐基础模型的结构可解释性框架:不把 SAE 特征当作孤立概念,而用半音移调把它们连成有序轨道。

    深度解读完整解读
  4. 可解释性arXiv 2609.04721

    研究:拒答方向可跨架构迁移,安全工具可按写入位置重新估计

    在写入点定位拒答方向,经刚性旋转跨架构迁移并门控放大

    发表
    测试
    Falcon-Mamba-7B、Falcon3-Mamba-7B、Llama-3.1-8B 等 8 个
    摘要拒答方向可经刚性旋转跨架构迁移,但必须在各架构的写入点读取。

    作者研究拒答表示是否随架构改变,结论是表示共享、读取位置随架构变。

    深度解读完整解读
  5. 可解释性arXiv 2609.23065

    从概念对齐到因果接地:思维链忠实性的干预检验

    用共享 SAE 检验 CoT 与直接预测的概念对齐和因果接地

    发表
    测试
    Llama-3.1-8B、Gemma-2-2B、Gemma-2-9B 等 5 个
    摘要共享 SAE 上的概念重叠只标出候选概念,Δp 才度量它们是否因果支撑答案,且该效应随层和架构变化。

    这篇工作把 CoT 忠实性从“说得像不像、输入归因像不像”改写成内部概念是否接地:CoT 有没有用到直接预测也在用的 SAE 概念,这些概念消掉以后答案概率会不会掉。

    深度解读完整解读
  6. 防御arXiv 2609.21996

    PIR:从模型内部激活读出被隐藏的答案

    提出免参考探测 PIR,从激活读出被隐瞒答案并区分擦除

    发表
    测试
    gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个

    摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    深度解读完整解读
  7. 防御arXiv 2609.30841

    为何扩散语言模型的越狱会成功:能量景观分析

    用能量势垒信号检测扩散语言模型的越狱

    发表
    测试
    LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    深度解读完整解读
已经到底了