可解释性arXiv 2610.09000·10月7日研究定位 LLaMA-2-7B-Chat 安全敏感参数定位安全敏感参数并稀疏改动权重以削弱安全对齐arXiv2610.09000发表10月7日层模型层场景模型与 API被测模型LLaMA-2-7B-Chat攻击模型篡改风险拒答失当深度解读完整解读
可解释性arXiv 2610.07518·10月6日TRACE:仅凭 checkpoint 更新审计大语言模型有害目标提出 TRACE,仅凭检查点更新审计有害合规微调目标arXiv2610.07518发表10月6日层训练与数据层场景模型与 API被测模型Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3、Qwen3-8B 等 6 个攻击模型篡改组件微调与开源权重摘要作者称有害合规 SFT 在检查点更新中留下可排序坐标,并据此做只读权重审计。作者在检查点更新里寻找有害合规 SFT 的目标组成,并把读数做成不查询模型、不看未知训练数据的审计分 TRACE。深度解读完整解读