研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留
论文形式化认证机理编辑:在Transformer的448维扰动下移除半径达0.0091,并证明黑盒测试无法保证移除。
- 0.0091Softmax+LN Transformer在448维嵌入扰动下的移除认证半径
- 0.0156门控Transformer在48维扰动下消除技能A的精确认证半径
- 0.0125门控Transformer在消除技能A后保留技能B的认证半径
解决现有机理编辑仅靠测试集验证无法覆盖连续输入空间、且黑盒测试无法在理论上排除微小存活区间的问题。
涉及解释性形式化验证、模型编辑偏差界与统计遗忘、黑盒不可行性理论以及几何信息流控制等相关研究。
通过SMT精确求解与CROWN边界传播,结合凸包松弛与双副本孪生编码,数学证明连续区域内的技能移除与非干涉。
在玩具MLP至Transformer上评测了认证半径、干预幻觉、手术与引导对比以及特征非干涉,反驳了黑盒测试的完备性。
作者指出方法受限于可判定规则假设、模型规模瓶颈与证明器松弛,后续需向真实语言模型与离散提示词扩展。
提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。