全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
用于提升鲁棒性的二次上界
推导对抗训练损失的二次上界(QUB)并用于快速对抗训练,显著提升鲁棒性,改进可能来自更平滑的损失曲面。
- 会议论文ICML 2025
Robust Secure Swap:屏蔽重点人物并可溯源的负责任换脸
换脸模型能拒绝对重点人物换脸,并为其他输出嵌入不可见水印以溯源,保护成功率 100%,水印提取准确率超 99%。
- 会议论文ICML 2025
两阶段 Learning-to-Defer 的对抗鲁棒性:算法与保证
首次研究两阶段 L2D 的对抗鲁棒性,提出破坏或操纵任务分配的攻击,并给出具一致性保证的防御算法 SARD。
- 会议论文ICML 2025
发现针对语言模型水印的伪造攻击
提出统计检验方法区分伪造与真实水印文本,发现学习型伪造方法都会留下可观测痕迹,检验功效高,说明现有伪造攻击效果不如此前认为。
- 会议论文ICML 2025
SEMU:基于奇异值分解的高效机器遗忘
用 SVD 构造低维投影,只修改少量参数且无需原训练数据即可选择性遗忘,以应对有害行为与安全监管需求。
- 会议论文ICML 2025
量化大语言模型的安全风险评估与量化感知安全修补
系统评测多种量化方法对 LLM 安全性的损害,并提出 Q-resafe 修补框架,使量化模型安全性恢复到量化前水平且尽量不损失效用。
- 会议论文ICML 2025
对抗训练中的干净泛化与鲁棒过拟合:表示复杂度与训练动力学
从表示复杂度和训练动力学两个角度理论分析对抗训练的鲁棒过拟合现象,证明网络会收敛到鲁棒记忆状态,并在真实图像数据上验证。
- 会议论文ICML 2025
GaussMarker:面向扩散模型的鲁棒双域水印
首个在空间域和频域同时嵌入水印的扩散模型水印方法,并引入噪声恢复器,在多种图像失真和高级攻击下取得领先检测效果。
- 会议论文ICML 2025
CLAT:利用关键性提升对抗鲁棒性的对抗训练
只微调鲁棒性关键层的少量参数以缓解对抗过拟合,可与现有对抗训练结合,干净精度与对抗鲁棒性提升超过 2%。
- 会议论文ICML 2025
生成模型中的极简概念擦除
仅基于最终生成输出的分布距离提出概念擦除目标,并结合神经元掩码提升鲁棒性,在流匹配模型上擦除概念且不损害整体性能。
- 会议论文ICML 2025
POROver:用过度生成与偏好优化提升安全并减少过度拒答
用强教师模型过度生成微调数据并结合偏好优化,安全与有用性 F1 由 74.4% 升至 91.8%,同时降低对良性请求的过度拒答。
- 会议论文ICML 2025
一石二鸟:从分布差异视角增强对抗防御
提出 DAD,用优化后的 MMD 同时训练去噪器并检测对抗样本,在 CIFAR-10 和 ImageNet-1K 上对自适应白盒攻击同时提升干净与鲁棒准确率。
- 会议论文ICML 2025
面向持续 LLM 遗忘的知识否定自适应定位
提出 ALKN,用动态掩码稀疏化梯度并按任务关系调整遗忘强度,在持续遗忘有害内容时兼顾遗忘效果与模型效用。
- 会议论文ICML 2025
释放大视觉语言模型能力实现可泛化、可解释的深度伪造检测
提出结合知识引导伪造检测器、提示学习器与 LLM 的框架,在多个基准上泛化性能优于 SOTA,并支持多轮对话解释。
- 会议论文ICML 2025
通过带随机性的可变形卷积提升对抗鲁棒性
将随机性引入网络结构而非输入,设计用随机掩码替代偏移的 stochastic deformable convolution,并分析鲁棒与干净精度权衡,在随机防御方法中达到 SOTA 鲁棒性与精度。
- 会议论文ICML 2025
EraseAnything:面向整流流 Transformer 的概念擦除
提出首个面向 SD v3、Flux 等流匹配 T2I 模型的概念擦除方法,采用双层优化、LoRA 与自对比学习,在多种擦除任务上达到领先。
- 会议论文ICML 2025
基于 Lipschitz 有界网络的高效鲁棒共形预测
用 Lipschitz 有界网络高效估计对抗扰动下的鲁棒共形预测集,在 ImageNet 等规模上集合更小、计算更快。
- 会议论文ICML 2025
不变性使 LLM 遗忘对未预期的下游微调保持鲁棒
基于不变风险最小化提出 ILU 框架,使 LLM 遗忘在多种下游微调后仍不易恢复,在 WMDP 上优于 NPO 和 RMU。
- 会议论文ICML 2025
图神经网络的自监督对抗净化
提出以 GPR-GAE 图自编码器作为独立净化器,在分类前清除结构扰动,在多种数据集和攻击下取得领先的鲁棒性。
- 会议论文ICML 2025
抵御再学习攻击的 LLM 遗忘:Sharpness-Aware Minimization 视角及拓展
将鲁棒遗忘与 SAM 联系起来,发现平滑性优化能缓解再学习攻击,在 WMDP 和 MUSE 上有效,并有助于防御输入级越狱。
- 会议论文ICML 2025
XAttnMark:基于交叉注意力的鲁棒音频水印
提出 XAttnMark,通过参数共享、交叉注意力消息检索和心理声学掩蔽损失,在检测与溯源上达到领先,并能抵御生成式编辑等变换。
- 会议论文NDSS 2025
BitShield:防御针对 DNN 可执行文件的比特翻转攻击
首个针对 DNN 可执行文件的 BFA 防御,基于语义完整性检查检测数据段与代码段翻转,平均缓解率 97.51%,开销约 2.47%。
- 会议论文NDSS 2025
人工耳蜗使用者面对音频深度伪造的影响研究
对 35 名人工耳蜗用户和 87 名听力正常者的实验显示,前者识别语音转换伪造仅约 67% 正确,并评估了 CI 模拟音频训练的检测器能否作为代理。
- 会议论文NDSS 2025
密度提升一切:同时改进恶意软件检测器性能、鲁棒性与可持续性
指出特征稀疏是投毒、规避与概念漂移的共同根源,用压缩技术和密度提升训练缓解稀疏,增强检测器对攻击的抵抗力。