防御arXiv:2610.09600 · 10月7日SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化提出安全电路对齐,把对齐更新限制在预训练拒绝电路内模型与 API·测试Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个·训练与数据层模型加固拒答失当摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。完整解读
分析与理论arXiv:2609.37312 · 9月29日研究:隐蔽推理必然留下信息痕迹,但思维链未必可读分析隐蔽推理在思维链中的信息足迹与不可读性模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Qwen 3.5 397B-A17B 等 12 个·模型层监控与审计欺骗与谋划推理链+1+1摘要论文从理论与实证探明了思维链监控的边界:复杂隐蔽计算必然泄露信息足迹且需承担长度税,但该足迹可被在线加密而不可读。完整解读