可解释性arXiv 2610.09000·10月7日研究定位 LLaMA-2-7B-Chat 安全敏感参数定位安全敏感参数并稀疏改动权重以削弱安全对齐arXiv2610.09000发表10月7日层模型层场景模型与 API被测模型LLaMA-2-7B-Chat攻击模型篡改风险拒答失当深度解读完整解读
可解释性arXiv 2609.06934·9月7日论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练arXiv2609.06934发表9月7日层模型层场景模型与 API被测模型Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个防御模型加固攻击模型篡改风险拒答失当组件微调与开源权重摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。深度解读完整解读