跳到正文
10月8日 · 周四

可解释性 · 论文

精选论文 20 篇
  1. 防御arXiv:2610.03502 · 53

    研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留

    论文形式化认证机理编辑:在Transformer的448维扰动下移除半径达0.0091,并证明黑盒测试无法保证移除。

    • 0.0091Softmax+LN Transformer在448维嵌入扰动下的移除认证半径
    • 0.0156门控Transformer在48维扰动下消除技能A的精确认证半径
    • 0.0125门控Transformer在消除技能A后保留技能B的认证半径
    6 问速览解决现有机理编辑仅靠测试集验证无法覆盖连续输入空间、且黑盒测试无法在理论上排除微小存活区间的问题。
    1. 这篇论文试图解决什么问题?

      解决现有机理编辑仅靠测试集验证无法覆盖连续输入空间、且黑盒测试无法在理论上排除微小存活区间的问题。

    2. 有哪些相关研究?

      涉及解释性形式化验证、模型编辑偏差界与统计遗忘、黑盒不可行性理论以及几何信息流控制等相关研究。

    3. 论文如何解决这个问题?

      通过SMT精确求解与CROWN边界传播,结合凸包松弛与双副本孪生编码,数学证明连续区域内的技能移除与非干涉。

    4. 论文做了哪些实验?

      在玩具MLP至Transformer上评测了认证半径、干预幻觉、手术与引导对比以及特征非干涉,反驳了黑盒测试的完备性。

    5. 有什么可以进一步探索的点?

      作者指出方法受限于可判定规则假设、模型规模瓶颈与证明器松弛,后续需向真实语言模型与离散提示词扩展。

    6. 总结一下论文的主要内容

      提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。

    完整解读
  2. 防御arXiv:2609.21996 · 55

    PIR:从模型内部激活读出被隐藏的答案

    作者提出免参考内部识别探测PIR,在8个模型上测得提示隐瞒识别准确率0.70至0.87,并区分隐瞒与擦除。

    • 0.70至0.878个模型在提示隐瞒下的PIR平衡解码准确率区间(Figure 3)
    • 0.892外部密码锁定gemma-2-9b的离分布探测器AUC(Table 1)
    • 0.39RMU遗忘后gemma-2-9b在WMDP上的识别准确率(Figure 2)
    6 问速览解决仅凭输出无法分辨模型是未知还是蓄意隐瞒的问题,建立免参考的内部知识读取与遗忘真伪鉴别方法。
    1. 这篇论文试图解决什么问题?

      解决仅凭输出无法分辨模型是未知还是蓄意隐瞒的问题,建立免参考的内部知识读取与遗忘真伪鉴别方法。

    2. 有哪些相关研究?

      梳理了内部状态真实性探测、表征工程与因果导引、欺骗与沙盒检测,以及机器遗忘机制四大领域的研究现状。

    3. 论文如何解决这个问题?

      借鉴隐瞒信息测试,构建选项末尾激活的对比识别方向,结合离分布差异分数实现免参考隐瞒检测与遗忘鉴别。

    4. 论文做了哪些实验?

      在8个模型上验证了PIR对提示隐瞒、沙盒及断路的检测有效性,并通过因果干预与遗忘实验划分了隐瞒与擦除边界。

    5. 有什么可以进一步探索的点?

      作者指出了候选依赖、白盒规避与基座依赖等局限,实验也显示开放推理与多类型外部验证尚未覆盖。

    6. 总结一下论文的主要内容

      论文提出免参考内部识别探测PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。

    完整解读
已经到底了