PIR:从模型内部激活读出被隐藏的答案
作者提出免参考内部识别探测PIR,在8个模型上测得提示隐瞒识别准确率0.70至0.87,并区分隐瞒与擦除。
- 0.70至0.878个模型在提示隐瞒下的PIR平衡解码准确率区间(Figure 3)
- 0.892外部密码锁定gemma-2-9b的离分布探测器AUC(Table 1)
- 0.39RMU遗忘后gemma-2-9b在WMDP上的识别准确率(Figure 2)
解决仅凭输出无法分辨模型是未知还是蓄意隐瞒的问题,建立免参考的内部知识读取与遗忘真伪鉴别方法。
梳理了内部状态真实性探测、表征工程与因果导引、欺骗与沙盒检测,以及机器遗忘机制四大领域的研究现状。
借鉴隐瞒信息测试,构建选项末尾激活的对比识别方向,结合离分布差异分数实现免参考隐瞒检测与遗忘鉴别。
在8个模型上验证了PIR对提示隐瞒、沙盒及断路的检测有效性,并通过因果干预与遗忘实验划分了隐瞒与擦除边界。
作者指出了候选依赖、白盒规避与基座依赖等局限,实验也显示开放推理与多类型外部验证尚未覆盖。
论文提出免参考内部识别探测PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。