防御arXiv:2610.09600 · 10月7日SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化提出安全电路对齐,把对齐更新限制在预训练拒绝电路内模型与 API·测试Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个·训练与数据层模型加固拒答失当摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。完整解读
防御arXiv:2609.21996 · 9月19日PIR:从模型内部激活读出被隐藏的答案提出内部识别探测器 PIR,从激活区分模型隐瞒与真实遗忘模型与 API·测试gemma-2-9b、gemma-3-12b、Qwen2.5-7B 等 9 个·模型层监控与审计欺骗与谋划监控器摘要论文提出免参考内部识别探测 PIR,划分了隐瞒与遗忘的边界,为评估沙盒审计与遗忘真实性提供了内部依据。完整解读