防御arXiv 2610.03502
研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留
提出机理编辑认证框架,在连续输入区域上证明技能移除与保留
- arXiv
- 2610.03502
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个
- 防御模型加固
摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。
提出机理编辑认证框架,在连续输入区域上证明技能移除与保留
摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。