防御arXiv:2610.09600 · 10月7日SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化提出安全电路对齐,把对齐更新限制在预训练拒绝电路内模型与 API·测试Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个·训练与数据层模型加固拒答失当摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。完整解读
可解释性arXiv:2610.05541 · 10月5日研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答模型与 API·测试Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT 等 5 个·模型层越狱拒答失当摘要论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。完整解读