全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文Anthropic Alignment ScienceICML 2026
AE Studio 与 Anthropic 提出 GRAM:用模块化预训练隔离危险知识的初步研究
AE Studio 与 Anthropic 合作提出 Gradient Routed Auxiliary Modules(GRAM),通过在 Transformer 每个 MLP 层加入辅助模块并按数据类型选择性更新,把危险知识隔离到可开关的模块中,从而在单次训练里近似多个按数据过滤分别训练的模型。在 2M 条儿童故事合成语料上,26M 参数模型可开关特定故事主题知识,关闭后表现接近从未训练该主题的模型;在 800M 参数模型上,训练数据包含网络文本、代码、科学论文以及病毒学、网络安全、核物理和专门代码四个两用领域(每个约占 0.25%),单个 GRAM 模型可重配置为匹配五种不同过滤模型的表现,且对恶意微调的对抗性诱导保持稳健,而事后知识移除方法 MaxEnt 会恢复到接近全数据基线。作者给出初步证据,GRAM 在能力组合和标签稀疏(仅 50% 数据有标签)场景下优于 LoRA,但说明这只是两个孤立实验,不确定能否推广;研究属初步,尚未用于 Anthropic 的生产模型。
- 会议论文ACL 2026
OASIS:通过正交自适应安全对齐策略缓解 LLM 有害微调攻击
将扰动投影到与有害梯度正交的方向,并只优化自适应选出的安全关键层;在 4 个 LLM 上将 Harmful Score 降低约 60%,下游效用保持稳定。
- 会议论文ACL 2026
CTRAP:嵌入坍塌陷阱以保护 LLM 免受有害微调
指出选择性遗忘易被重新学习绕过,提出在对齐时植入陷阱,一旦微调试图撤销安全对齐就令模型能力坍塌,良性微调不受影响。
- 会议论文ACL 2026
SGT:用安全引导触发器保护开源 LLM 免受恶意微调
刻画安全区域,先优化安全触发器再对齐内部特征,使攻击者需大幅增加数据量才能破坏安全,表征在恶意微调下保持稳定。
- 会议论文ACL 2026
HarmRLVR:利用可验证奖励实现有害对齐
仅用 64 条无回复的有害提示做 GRPO 即可快速逆转安全对齐,五个模型平均攻击成功率 96.01%,优于有害微调且保持通用能力。
- 会议论文ACL 2026
对齐与失效:微调如何破坏并恢复大模型安全
比较六种微调方法对四个模型的安全破坏与恢复效果,发现ORPO最善于破坏对齐,DPO最善于恢复对齐,但会牺牲模型效用。
- 会议论文ACL 2026
合成数据来源多样性对大语言模型微调的影响
发现多源合成数据可缓解分布坍缩,但人类与合成数据微调均可能移除安全防护,且合成数据微调后的有害输出可能更具可用性。
- 会议论文ICLR 2026
自毁灭语言模型:抵御有害微调攻击
提出防御方法SEAM,通过耦合良性与有害数据的优化轨迹将大模型转化为自毁灭模型,在遭受恶意微调时性能严重退化甚至崩溃,从根本上抵御微调安全攻击。
- 会议论文ICLR 2026
单样本安全修复:仅用单个样本修复微调后的大模型
发现仅需单个安全样本即可完全恢复微调大语言模型受损的安全对齐,揭示了安全梯度的低秩特性,在不损失实用性的前提下实现极低成本修复。
- 会议论文ICLR 2026
安全子空间并非线性独立:微调案例研究
实证研究发现安全行为与通用学习组件高度纠缠,安全子空间在权重和激活空间中重叠,表明基于子空间的微调防御存在根本局限。
- 会议论文ICLR 2026
评估开源权重前沿大语言模型的最坏情况风险
提出恶意微调方法评估开源模型在生物和网络安全领域的危险能力上限,发现其能力低于前沿闭源模型,表明发布开源模型带来的净新增危害有限。
- 会议论文ICLR 2026
Deep Ignorance:过滤预训练数据为开源权重 LLM 构建抗篡改防护
通过过滤生物威胁相关预训练数据,模型对长达 10,000 步的对抗微调有显著抗性,且不损害其他能力;但上下文提供信息时仍可利用,需纵深防御。
- 会议论文ICML 2026
良性多语言微调对模型安全的异构影响
该研究针对开源大模型揭示了良性多语言微调对安全对齐的破坏,发现使用非英语良性数据微调可使模型对对抗提示的遵从率提升最高达四倍,且安全漂移呈现显著异构性。
- 会议论文ICML 2026
Surgery:利用注意力汇聚机制防御大模型有害微调
发现学习有害模式的注意力头可通过汇聚散度符号区分,提出微调防御方法Surgery,通过正则化抑制汇聚散度以减少模型对有害模式的学习。
- 会议论文ICML 2026
安全锚点:利用几何瓶颈防御有害微调攻击
分析大模型在高维参数空间冗余导致微调防御失效的机理,提出安全瓶颈正则化SBR,将有害提示词最终隐状态锚定在解嵌入层,在保持下游性能的同时抵御有害微调。
- 会议论文ICML 2026
从参数动力学到风险评分:量化大模型微调中的样本级安全退化
揭示微调导致安全退化的参数漂移动力学机制,提出样本级量化方法SQSD,通过衡量参数在安全与危险方向的更新来评估微调样本破坏安全对齐的风险。
- 会议论文ICML 2026
SPARD:基于安全投影与相关性-多样性数据选择的有害微调防御
针对有害微调攻击破坏大模型安全对齐的问题,提出交替优化效用更新与显式安全投影的SPARD框架,在保持高任务精度的同时显著降低攻击成功率。
- 会议论文ICML 2026
通过尺度敏感损失曲面使模型不可合并
针对开源权重被恶意合并绕过安全对齐的问题,提出架构无关的保护框架Trap²,使模型在单独使用时保持有效,但在模型合并发生权重重缩放时性能退化,阻止未授权重组。
- 会议论文ACL 2025
SDD:以自退化防御恶意微调
提出 SDD,使模型对有害提示生成高质量但无关的回复,恶意微调时通用能力显著退化,从而抑制有害指令执行,实验验证其有效性。
- 会议论文ICLR 2025
开源大语言模型的防篡改安全护栏
针对开源大模型安全护栏易被微调篡改的问题,提出防篡改方法TAR,使模型在经历数百步微调后仍能保持安全防御,同时保留良性能力。
- 会议论文ICLR 2025
SEAL:基于双层数据选择的安全增强对齐大模型微调
针对微调导致大模型预置对齐与安全能力退化的问题,提出基于双层优化的数据排序框架SEAL,筛选高安全与高质量微调数据以维持模型安全性。
- 会议论文ICLR 2025
遗忘还是混淆?通过良性重学习唤醒已遗忘大语言模型的记忆
揭示现有大模型遗忘方法极易受良性重学习攻击,少量弱相关数据即可恢复有害生物武器知识与记忆文本。
- 会议论文ICLR 2025
关于开源权重前沿模型安全护栏持久性评估的探讨
评估旨在抵御微调修改的开源权重模型持久防护,揭示现有评测极易产生误导并指出防御的实际失效模式。
- 会议论文ICLR 2025
安全如我:缓解大语言模型特定任务微调中的安全风险
揭示了攻击者可通过操纵特定任务数据集结构以诱发危险模型行为并破坏安全对齐,提出通过混合模仿下游任务格式的安全数据来有效恢复安全对齐。