全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
UnHype:CLIP 引导的超网络动态 LoRA 遗忘
在单/多概念 LoRA 遗忘中引入超网络,推理时依据 CLIP 嵌入动态生成 LoRA 权重,用于物体、名人与显式内容的擦除,更具语境感知和可扩展性。
- 会议论文ICML 2026
MAGIC:协同演化的攻防对抗博弈以实现稳健 LLM 安全
将安全对齐建模为多轮多智能体 RL 的攻防博弈,攻击者不断改写查询暴露长尾漏洞、防御者随之泛化;攻击者演化出新的组合策略,防御成功率更高且不损害有用性。
- 会议论文ICML 2026
文本扩散模型的安全感知去噪器
SAD 在推理时修改迭代去噪过程,将生成引向可证明安全的区域,无需重训,在有害类别、记忆和越狱评测中显著减少不安全生成。
- 会议论文ICML 2026
无需训练的测试时解毒
用零阶优化近似补全毒性对输入嵌入的梯度,仅需嵌入、毒性打分函数和前向评估即可在测试时引导生成,在多种模型上取得较好的毒性与质量权衡。
- 会议论文ICML 2026
Z-Erase:单流扩散 Transformer 中的概念擦除
提出首个面向单流文生图模型(如 Z-Image)的概念擦除方法,通过流解耦框架与拉格朗日自适应调制避免生成崩溃,并给出收敛到 Pareto 稳定点的证明。
- 会议论文ICML 2026
RADAR:动态防御 RAG 的检索污染
将可靠上下文选择建模为图能量最小化并用 Max-Flow Min-Cut 求解,借助贝叶斯记忆节点更新信念,在动态数据集上鲁棒性更好且存储开销小。
- 会议论文ICML 2026
基于迭代自改进码本的安全自回归图像生成
提出利用多模态模型自身识别不安全生成并迭代微调码本,在消除有害映射的同时保证图像质量。
- 会议论文ICML 2026
抵御对抗攻击的概率鲁棒性认证
提出一种基于障碍证书的概率框架,将对抗鲁棒性表述为安全验证任务,为随机训练下的模型提供最坏情况范数扰动的形式化鲁棒半径保证。
- 会议论文ICML 2026
SafeCompass:基于推理时安全信号的动态思维链 steering
从内部表示提取潜在安全方向,仅在推理轨迹变得不安全时干预,攻击成功率最多降至最佳基线的十分之一,并减少过度拒答。
- 会议论文ICML 2026
去噪扩散采样的对抗攻击与防御
针对扩散采样提出在采样阶段注入扰动的攻击,并提出局部变分正则化防御,实验显示攻击显著削弱现有方法而防御可有效抵御。
- 会议论文ICML 2026
通过在线自我博弈强化学习追踪移动目标以构建更安全的语言模型
提出全在线自我博弈多智能体强化学习算法Self-RedTeam,使攻防双方持续协同进化,在发现更多样攻击的同时将大模型安全性提升最高达95%。
- 会议论文ICML 2026
Meerkat-VL:通过感知推理与自验证实现多模态 LLM 的隐式风险安全对齐
构建首个隐式风险标注数据集,并用规范性感知自验证提供更密集可靠的奖励以缓解 reward hacking;多模态安全基准上安全性与有用性分别提升 16% 和 13%。
- 会议论文ICML 2026
基于混合随机平滑的异构扰动下可信鲁棒性
提出混合随机平滑框架,统一了离散文本与连续图像的联合扰动认证,首次为图文交互安全过滤提供了模型无关的奈曼-皮尔逊形式鲁棒性认证。
- 会议论文ICML 2026
对比谱校正:CLIP 零样本对抗鲁棒性的测试时防御
发现对抗样本在频率衰减下特征不一致,提出 CSR 测试时防御,在 16 个基准上对强 APGD 攻击平均超 SOTA 18.1%。
- 会议论文ICML 2026
解耦意图与角色:用于角色无关安全对齐的对抗自博弈
针对大模型易受基于角色的越狱攻击影响,提出对抗自博弈框架PIA,在防御端通过单向KL散度约束将安全决策与角色解耦,在维持通用能力的同时大幅降低越狱成功率。
- 会议论文ICML 2026
通过序列熵变检测流畅的优化型对抗提示词
将针对大模型的对抗后缀检测建模为序列熵在线变点检测问题,提出免训练检测器CPD,有效识别GCG等多种优化攻击并定位后缀,可作为安全护栏的前置门控降低调用开销。
- 会议论文ICML 2026
推理模型安全恢复仅需早期几步引导
提出轻量级推理期防御SafeThink,通过监控思维链并在违规时注入修正前缀,仅需在前1至3步推理进行干预即可大幅降低越狱攻击成功率。
- 会议论文ICML 2026
前沿图像生成模型的概念移除
用 transcoder 替换模型内部瓶颈层,使特定概念特征可被关闭;在 SD3.5、Flux、Infinity 上取得领先的概念移除效果,并对对抗提示保持鲁棒。
- 会议论文ICML 2026
奖励投毒攻击下的鲁棒上下文强化学习
针对 Decision-Pretrained Transformer 的奖励投毒攻击,提出对抗训练框架 AT-DPT,同时训练攻击者与 DPT,在 bandit 及更复杂环境中优于鲁棒基线。
- 会议论文ICML 2026
从错误中学习:面向安全代码大模型的树状自我博弈
针对代码大模型易生成安全漏洞的问题,提出树状自我博弈框架TSP,通过构建决策树让模型在分支轨迹中辨别局部错误,显著提升安全通过率并减少未知CWE漏洞。
- 会议论文ICML 2026
基于稀疏权重编辑的多语言安全对齐
针对低资源语言容易绕过安全护栏的问题,提出通过稀疏权重编辑将低资源语言有害表征映射至高资源语言安全子空间,在免训练下显著降低攻击成功率。
- 会议论文ICML 2026
统一文本评分模型的对抗鲁棒性与对抗训练
将对抗攻击与对抗训练拓展并统一至密集检索器、重排器和奖励模型等文本评分模型中,所提出的互补对抗训练方法能显著提升鲁棒性,并在RLHF中有效缓解奖励作弊。
- 会议论文ICML 2026
迈向安全的量化感知微调:理解并缓解安全对齐退化
发现量化 LLM 在微调中更易丧失安全对齐,源于量化误差;提出 ExSQF,在保持下游性能的同时恢复安全,优于全精度安全微调基线。
- 会议论文ICML 2026
HyperPotter:在音频深度伪造检测中利用高阶交互
提出基于超图的框架,通过聚类超边捕捉高阶交互;在 13 个测试集上平均 EER 相对降低 12.68%,但在严重编解码失真下鲁棒性有限。