全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
对抗训练中的干净泛化与鲁棒过拟合:表示复杂度与训练动力学
从表示复杂度和训练动力学两个角度理论分析对抗训练的鲁棒过拟合现象,证明网络会收敛到鲁棒记忆状态,并在真实图像数据上验证。
- 会议论文ICML 2025
GaussMarker:面向扩散模型的鲁棒双域水印
首个在空间域和频域同时嵌入水印的扩散模型水印方法,并引入噪声恢复器,在多种图像失真和高级攻击下取得领先检测效果。
- 会议论文ICML 2025
CLAT:利用关键性提升对抗鲁棒性的对抗训练
只微调鲁棒性关键层的少量参数以缓解对抗过拟合,可与现有对抗训练结合,干净精度与对抗鲁棒性提升超过 2%。
- 会议论文ICML 2025
生成模型中的极简概念擦除
仅基于最终生成输出的分布距离提出概念擦除目标,并结合神经元掩码提升鲁棒性,在流匹配模型上擦除概念且不损害整体性能。
- 会议论文ICML 2025
POROver:用过度生成与偏好优化提升安全并减少过度拒答
用强教师模型过度生成微调数据并结合偏好优化,安全与有用性 F1 由 74.4% 升至 91.8%,同时降低对良性请求的过度拒答。
- 会议论文ICML 2025
一石二鸟:从分布差异视角增强对抗防御
提出 DAD,用优化后的 MMD 同时训练去噪器并检测对抗样本,在 CIFAR-10 和 ImageNet-1K 上对自适应白盒攻击同时提升干净与鲁棒准确率。
- 会议论文ICML 2025
面向持续 LLM 遗忘的知识否定自适应定位
提出 ALKN,用动态掩码稀疏化梯度并按任务关系调整遗忘强度,在持续遗忘有害内容时兼顾遗忘效果与模型效用。
- 会议论文ICML 2025
释放大视觉语言模型能力实现可泛化、可解释的深度伪造检测
提出结合知识引导伪造检测器、提示学习器与 LLM 的框架,在多个基准上泛化性能优于 SOTA,并支持多轮对话解释。
- 会议论文ICML 2025
通过带随机性的可变形卷积提升对抗鲁棒性
将随机性引入网络结构而非输入,设计用随机掩码替代偏移的 stochastic deformable convolution,并分析鲁棒与干净精度权衡,在随机防御方法中达到 SOTA 鲁棒性与精度。
- 会议论文ICML 2025
EraseAnything:面向整流流 Transformer 的概念擦除
提出首个面向 SD v3、Flux 等流匹配 T2I 模型的概念擦除方法,采用双层优化、LoRA 与自对比学习,在多种擦除任务上达到领先。
- 会议论文ICML 2025
基于 Lipschitz 有界网络的高效鲁棒共形预测
用 Lipschitz 有界网络高效估计对抗扰动下的鲁棒共形预测集,在 ImageNet 等规模上集合更小、计算更快。
- 会议论文ICML 2025
不变性使 LLM 遗忘对未预期的下游微调保持鲁棒
基于不变风险最小化提出 ILU 框架,使 LLM 遗忘在多种下游微调后仍不易恢复,在 WMDP 上优于 NPO 和 RMU。
- 会议论文ICML 2025
图神经网络的自监督对抗净化
提出以 GPR-GAE 图自编码器作为独立净化器,在分类前清除结构扰动,在多种数据集和攻击下取得领先的鲁棒性。
- 会议论文ICML 2025
抵御再学习攻击的 LLM 遗忘:Sharpness-Aware Minimization 视角及拓展
将鲁棒遗忘与 SAM 联系起来,发现平滑性优化能缓解再学习攻击,在 WMDP 和 MUSE 上有效,并有助于防御输入级越狱。
- 会议论文ICML 2025
XAttnMark:基于交叉注意力的鲁棒音频水印
提出 XAttnMark,通过参数共享、交叉注意力消息检索和心理声学掩蔽损失,在检测与溯源上达到领先,并能抵御生成式编辑等变换。
- 会议论文NDSS 2025
BitShield:防御针对 DNN 可执行文件的比特翻转攻击
首个针对 DNN 可执行文件的 BFA 防御,基于语义完整性检查检测数据段与代码段翻转,平均缓解率 97.51%,开销约 2.47%。
- 会议论文NDSS 2025
人工耳蜗使用者面对音频深度伪造的影响研究
对 35 名人工耳蜗用户和 87 名听力正常者的实验显示,前者识别语音转换伪造仅约 67% 正确,并评估了 CI 模拟音频训练的检测器能否作为代理。
- 会议论文NDSS 2025
密度提升一切:同时改进恶意软件检测器性能、鲁棒性与可持续性
指出特征稀疏是投毒、规避与概念漂移的共同根源,用压缩技术和密度提升训练缓解稀疏,增强检测器对攻击的抵抗力。
- 会议论文NDSS 2025
I know what you MEME!:用多模态大模型理解与检测有害 Meme
分析视觉艺术与宣传技巧如何削弱现有有害 Meme 检测,提出基于自适应提示与 CoT 的 HMGUARD,准确率达 0.92。
- 会议论文NDSS 2025
Probe-Me-Not:保护预训练编码器免受恶意探测
提出 EncoderLock,使编码器在被禁止的领域上探测性能很差而在授权领域保持效用,含监督、无监督与零样本三种变体。
- 会议论文NDSS 2025
THEMIS:约束 Textual Inversion 以实现个性化概念审查
向 Textual Inversion 嵌入注入正向后门,使敏感词与嵌入组合时输出预设图像而非有害内容,并可抵御自适应攻击。
- 会议论文NDSS 2025
理解不安全视频生成
构建首个视频生成模型的不安全视频数据集并归纳 5 类不安全内容,提出在采样过程内部工作的防御方法,准确率达 0.90 且资源开销降低 10 倍。
- 会议论文NDSS 2025
VoiceRadar:基于微频率与组成分析的语音深度伪造检测
用多普勒效应和鼓面振动物理模型提取微频率并融入损失函数,在新构建数据集上优于现有方法,可识别 AI 生成语音。
- 会议论文NeurIPS 2025
通过嵌入扭曲缓解文生图扩散模型的色情内容生成
提出 DES,将不安全嵌入映向安全区域并中和 nudity 嵌入,在 FLUX.1 上攻击成功率降至 9.47%,同时保持图像质量。