分析与理论arXiv:2610.10203 · 10月7日研究者提出模型生物体多目标验证框架并给出训练建议提出模型生物多目标验证与合并训练方法以减少能力损伤模型与 API·测试gemma-2-2b-it、olmo-2-1b、llama-3.1-8b-it 等 8 个·训练与数据层摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。完整解读
防御arXiv:2610.09600 · 10月7日SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化提出安全电路对齐,把对齐更新限制在预训练拒绝电路内模型与 API·测试Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个·训练与数据层模型加固拒答失当摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。完整解读