可解释性arXiv 2610.09000·10月7日研究定位 LLaMA-2-7B-Chat 安全敏感参数定位安全敏感参数并稀疏改动权重以削弱安全对齐arXiv2610.09000发表10月7日层模型层场景模型与 API被测模型LLaMA-2-7B-Chat攻击模型篡改风险拒答失当深度解读完整解读