跳到正文
10月8日 · 周四

可解释性 · 论文

找到 15 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 176 篇还没打标签,不在筛选结果里。

另有 104 篇还没有研究类型,暂不在这些分类里。

  1. 防御arXiv:2609.01878 ·

    GAPS:面向条件激活引导的维度级门控

    GAPS 在 token 级条件 steering 上增加按神经元的可分性门与后验门。

    测试Gemma-3 (4B)、Qwen-3 (1.7B)
    摘要GAPS 用两道维度门补上条件 steering 的空间选择性。

    GAPS 为 activation steering 增加维度级条件:在决定何时干预之外,再决定当前该动哪些神经元。

    完整解读
  2. 防御arXiv:2609.03629 ·

    EraseSAE:用稀疏自编码器在文生视频扩散模型中实现精准概念擦除

    AI 导读EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。

    测试CogVideoX-5B、HunyuanVideo、Flux.1 [dev]
    摘要EraseSAE 用单义特征局部擦除。

    EraseSAE 把 SAE 用于 DiT 文生视频模型的概念擦除。作者要解决的是:全局改权重或表面负提示对不齐细粒度、分布式的概念,而且会改到无关时空区域。

    完整解读
  3. 对齐/训练方法arXiv:2609.05800 ·

    Spillover-Aware Multi-Value Steering:面向多元对齐的 LLM 激活引导去纠缠方法

    AI 导读针对多元对齐中同时引导多个价值维度时出现的溢出效应,研究者提出 Spillover-Aware Multi-Value Steering 方法,将溢出归因于引导方向的几何纠缠(由 Gram 矩阵刻画),并从激活范数惩罚目标推导出零成本校正以精确解耦各方向贡献。

    测试Llama-3.2-3B-Instruct、Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct 等 4 个
    完整解读
  4. 防御arXiv:2609.11085 ·

    超越求解器判定:面向自动形式化的生成式奖励模型

    AI 导读研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。

    测试GenV+HN、GenV、27B LM (LoRA) 等 15 个
    摘要GenV+HN 用离线 Z3 等价标签训练无参考 Yes/No 分数,用来标记 VPU 并分配测试时计算。

    GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。

    完整解读
  5. 防御arXiv:2609.34970 ·

    研究揭示 LLM 涌现失准的机制并提出参数空间缓解框架

    对四个开源指令模型族做窄域微调,用方向 Hessian 与 Grassmann 子空间诊断涌现失准,并把有害梯度子空间从 LoRA 更新中正交投影出去。

    测试Qwen2.5-3B-IT、Qwen2.5-7B-IT、Qwen2.5-14B-IT 等 8 个
    摘要窄域 LoRA 会留下可测的有害子空间。

    See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。

    完整解读
  6. 对齐/训练方法arXiv:2609.38645 ·

    用探针引导微调对齐模型且不损失可监控性

    作者用持续更新的探针做微调,在保留线性可监测性的同时降低有害性并提高诚实性。

    测试Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Llama 3 8B Instruct 等 4 个
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    完整解读
  7. 防御arXiv:2609.30841 ·

    为何扩散语言模型的越狱会成功:能量景观分析

    作者把 dLLM 安全对齐解释为去噪能量势垒,并用 R0、SED slope、ΔE slope 三个免训练信号检测越狱。已知攻击里躲开全部信号的配置也未生成有害内容。

    测试LLaDA-8B-Instruct、LLaDA-1.5、Dream-v0-Instruct-7B 等 4 个
    摘要能量势垒把 dLLM 越狱分成掩盖初始状态或中途越垒,三个 logit 信号据此互补检测。

    Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。

    完整解读
已经到底了