防御arXiv:2610.09600 · 10月7日SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化提出安全电路对齐,把对齐更新限制在预训练拒绝电路内模型与 API·测试Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个·训练与数据层模型加固拒答失当摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。完整解读
防御arXiv:2610.03502 · 10月3日研究者提出可认证机制编辑:在连续输入区域上证明技能移除与保留提出机理编辑认证框架,在连续输入区域上证明技能移除与保留模型与 API·测试Toy MLP (separated)、Toy MLP (entangled)、Deep MLP (3-12-8-2) 等 6 个·模型层模型加固摘要提出机理编辑形式化认证框架,证明编辑在连续区域生效且黑盒测试无法保证移除,为安全编辑提供数学证明。完整解读