防御arXiv 2610.03502
研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留
提出机理编辑认证框架,在连续输入区域上证明技能移除与保留
- arXiv
- 2610.03502
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个
- 防御模型加固
摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。
提出机理编辑认证框架,在连续输入区域上证明技能移除与保留
摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。
评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御
本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。
提出 SPAR 免训练干预,分离注意力结构偏置并减轻多模态幻觉
SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全