全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2026
Deep Ignorance:过滤预训练数据为开源权重 LLM 构建抗篡改防护
通过过滤生物威胁相关预训练数据,模型对长达 10,000 步的对抗微调有显著抗性,且不损害其他能力;但上下文提供信息时仍可利用,需纵深防御。
- 会议论文ICML 2026
良性多语言微调对模型安全的异构影响
该研究针对开源大模型揭示了良性多语言微调对安全对齐的破坏,发现使用非英语良性数据微调可使模型对对抗提示的遵从率提升最高达四倍,且安全漂移呈现显著异构性。
- 会议论文ICML 2026
Surgery:利用注意力汇聚机制防御大模型有害微调
发现学习有害模式的注意力头可通过汇聚散度符号区分,提出微调防御方法Surgery,通过正则化抑制汇聚散度以减少模型对有害模式的学习。
- 会议论文ICML 2026
安全锚点:利用几何瓶颈防御有害微调攻击
分析大模型在高维参数空间冗余导致微调防御失效的机理,提出安全瓶颈正则化SBR,将有害提示词最终隐状态锚定在解嵌入层,在保持下游性能的同时抵御有害微调。
- 会议论文ICML 2026
从参数动力学到风险评分:量化大模型微调中的样本级安全退化
揭示微调导致安全退化的参数漂移动力学机制,提出样本级量化方法SQSD,通过衡量参数在安全与危险方向的更新来评估微调样本破坏安全对齐的风险。
- 会议论文ICML 2026
SPARD:基于安全投影与相关性-多样性数据选择的有害微调防御
针对有害微调攻击破坏大模型安全对齐的问题,提出交替优化效用更新与显式安全投影的SPARD框架,在保持高任务精度的同时显著降低攻击成功率。
- 会议论文ICML 2026
通过尺度敏感损失曲面使模型不可合并
针对开源权重被恶意合并绕过安全对齐的问题,提出架构无关的保护框架Trap²,使模型在单独使用时保持有效,但在模型合并发生权重重缩放时性能退化,阻止未授权重组。
- 会议论文ACL 2025
SDD:以自退化防御恶意微调
提出 SDD,使模型对有害提示生成高质量但无关的回复,恶意微调时通用能力显著退化,从而抑制有害指令执行,实验验证其有效性。
- 会议论文ICLR 2025
开源大语言模型的防篡改安全护栏
针对开源大模型安全护栏易被微调篡改的问题,提出防篡改方法TAR,使模型在经历数百步微调后仍能保持安全防御,同时保留良性能力。
- 会议论文ICLR 2025
SEAL:基于双层数据选择的安全增强对齐大模型微调
针对微调导致大模型预置对齐与安全能力退化的问题,提出基于双层优化的数据排序框架SEAL,筛选高安全与高质量微调数据以维持模型安全性。
- 会议论文ICLR 2025
遗忘还是混淆?通过良性重学习唤醒已遗忘大语言模型的记忆
揭示现有大模型遗忘方法极易受良性重学习攻击,少量弱相关数据即可恢复有害生物武器知识与记忆文本。
- 会议论文ICLR 2025
关于开源权重前沿模型安全护栏持久性评估的探讨
评估旨在抵御微调修改的开源权重模型持久防护,揭示现有评测极易产生误导并指出防御的实际失效模式。
- 会议论文ICLR 2025
安全如我:缓解大语言模型特定任务微调中的安全风险
揭示了攻击者可通过操纵特定任务数据集结构以诱发危险模型行为并破坏安全对齐,提出通过混合模仿下游任务格式的安全数据来有效恢复安全对齐。
- 会议论文ICLR 2025
Booster:通过衰减有害扰动抵御大模型有害微调攻击
针对微调服务中的有害微调攻击,提出对齐阶段正则化方法Booster,通过衰减模型权重上的有害扰动降低微调带来的安全风险。
- 会议论文ICML 2025
Antidote:针对有害微调攻击的微调后安全对齐
发现现有防御在大学习率或多轮微调下失效,提出微调后一次性剪除有害权重的 Antidote,可降低有害分数并保持下游精度。
- 会议论文ICML 2025
漏洞感知对齐:缓解有害微调中的不均匀遗忘
发现部分对齐数据在有害微调中更易被遗忘,据此提出 VAA,用 Group DRO 均衡学习,在四类微调任务上显著降低有害得分。
- 会议论文ICML 2025
良性样本也重要:在离群良性样本上微调会严重破坏安全性
用 Self-Inf-N 从良性数据中挑出 100 个离群样本微调,即可严重破坏七种主流 LLM 的安全对齐,且多数现有缓解手段失效。
- 会议论文ICML 2025
条件数视角下的模型免疫
提出基于 Hessian 条件数的框架分析模型免疫,设计正则化算法使预训练模型难以在有害任务上微调,并在线性与深度模型上验证。
- 会议论文NDSS 2025
针对大语言模型的安全错位攻击
系统评测系统提示修改、微调和模型编辑等安全错位方法,发现 SFT 最强,并提出无需有害回复的 SSRA 攻击与 SSRD 重对齐防御。
- 会议论文NeurIPS 2025
ErrorTrace:基于模型家族错误空间的黑盒溯源机制
针对开源 LLM 被低成本衍生的知识产权风险,利用模型家族独特的错误模式做黑盒溯源,对 27 个基座模型溯源准确率达 0.8518,并能追踪微调、剪枝和合并模型。
- 会议论文NeurIPS 2025
蒸馏使遗忘更稳健
发现少量微调即可恢复被遗忘能力,提出 UNDO 将遗忘后的模型蒸馏到加噪副本,在 WMDP 上实现更稳健的能力移除。
- 会议论文NeurIPS 2025
逐点防御 LLM 微调 API 的根本局限
证明检测单个有害样本的逐点防御存在根本局限,用全为良性样本的攻击在 OpenAI 微调 API 上套取有害知识,并绕过增强监控。
- 会议论文NeurIPS 2025
从休眠到删除:基于权重空间正则化的抗篡改遗忘
发现遗忘方法易受再学习攻击,仅在保留集上微调即可恢复遗忘知识;据权重空间性质提出新方法,提升抗再学习攻击能力。
- 会议论文NeurIPS 2025
过拟合攻击:仅用 10 条良性样本微调即可越狱 LLM
先用相同拒答的良性样本使模型过拟合,再用普通良性回答微调使其遗忘拒答,在十个 LLM 上攻击效果与隐蔽性均优于五个基线。