全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
ASTrA:带自适应攻击的对抗式自监督训练
提出可学习的攻击策略网络,用对比损失奖励和 REINFORCE 自动发现攻击参数,在 CIFAR10/100、STL10 上取得最优的自监督对抗鲁棒性。
- 会议论文ICLR 2025
有界Levenshtein距离下的可验证鲁棒性
提出首个针对Levenshtein距离计算卷积分类器Lipschitz常数的方法LipsLev,能单次前向传播计算可验证半径并提升防御效率。
- 会议论文ICLR 2025
UniDetox:基于数据集蒸馏的大语言模型通用去毒化
提出基于对比解码的数据集蒸馏方法UniDetox,将去毒化表征提炼为合成文本,使通用去毒化微调无需针对各模型单独调优即可有效降低多种大语言模型的毒性。
- 会议论文ICLR 2025
视觉-语言适配如何影响视觉语言模型的安全性?
揭示视觉语言模型在多模态适配过程中存在内在安全能力退化现象,分析表明安全微调易导致过度拒答,进而提出通过模型权重合并兼顾模型安全性与有用性。
- 会议论文ICLR 2025
探究对抗训练中的遗忘:一种增强鲁棒性的新方法
发现对抗训练中存在类似持续学习的灾难性遗忘,提出 AMS 自蒸馏正则,提升 PGD、CW、AutoAttack 下的鲁棒准确率并缓解鲁棒过拟合。
- 会议论文ICLR 2025
奇妙的版权角色及如何(不)生成它们
评测显示图像和视频生成模型仅用通用关键词就可能生成版权角色,DALL·E 式提示改写不足,需配合负面提示等策略。
- 会议论文ICLR 2025
ADBM:用于可靠对抗净化的对抗扩散桥模型
提出对抗扩散桥模型ADBM,直接构建从加噪对抗样本到干净样本的反向桥,显著提升对抗净化防御能力。
- 会议论文ICLR 2025
分数遗忘蒸馏:扩散模型中快速无数据的机器遗忘方法
提出分数遗忘蒸馏方法SFD,通过将不安全概念的条件分数与安全概念对齐,在无需真实数据的情况下消除扩散模型中的有害生成内容。
- 会议论文ICLR 2025
SAFREE:用于安全文本到图像和视频生成的免训练自适应护栏
提出免训练护栏SAFREE,通过在文本嵌入空间规避毒性子空间并在扩散潜空间引入自适应重注意力,有效抑制文生图和视频中的不安全内容。
- 会议论文ICLR 2025
大语言模型能够成为强大的自我去毒者
提出轻量级受控解码算法SASA,仅利用LLM内部表征学习毒性子空间并动态调整采样策略,无需重训即可显著降低生成内容的毒性。
- 会议论文ICLR 2025
面向生成式图像模型的不可检测水印
提出首个不可检测的生成式图像模型水印方案,利用伪随机纠错码在不降低图像质量的前提下抵抗现有的水印去除攻击。
- 会议论文ICLR 2025
用于对抗鲁棒蒸馏的间接梯度匹配
提出间接梯度蒸馏模块IGDM,通过将学生的输入梯度与教师梯度间接匹配,显著提升小模型在AutoAttack评估下的对抗鲁棒性。
- 会议论文ICLR 2025
语义损失引导的高数据效率大模型安全响应监督微调
提出结合语义代价与负推土机距离损失的监督微调方法,仅需少量模型自身的有害响应即可引导其远离不安全输出,实现高效的安全训练并探讨了过度对齐问题。
- 会议论文ICLR 2025
ConceptPrune:基于关键神经元剪枝的扩散模型概念编辑
提出免训练的ConceptPrune方法,通过剪枝约0.12%的关键权重擦除裸露等不安全概念,有效防御白盒与黑盒对抗性越狱攻击。
- 会议论文ICLR 2025
可证明保护分类器免受OOD和对抗样本影响的方法
提出基于极值理论的SPADE方法,利用隐空间广义极值模型对分布外和对抗样本进行形式化表征与拒识,为分类器提供可证明的安全保护。
- 会议论文ICLR 2025
作为 DPO 稳健去噪变体的模型编辑:毒性消除案例研究
提出免微调的模型编辑方法 ProFS,通过识别并投影消除模型参数空间中的毒性子空间来降低模型毒性,在样本效率和抗噪性上优于 DPO。
- 会议论文ICLR 2025
AdvPaint:通过对抗性注意力扰动防御图像修复篡改
针对扩散模型被恶意用于图像修复篡改的威胁,提出 AdvPaint 防御框架,通过针对自注意力和交叉注意力的对抗扰动破坏语义交互,有效阻止未经授权的图像篡改。
- 会议论文ICLR 2025
超越Token分析:防御大模型社会工程攻击的超图度量空间框架
提出一种基于超图度量空间的LLM安全过滤方法,通过建模Token嵌入的几何结构与信息流差异区分良性与恶意提示,有效防御基于说服的社会工程越狱攻击。
- 会议论文ICLR 2025
Jailbreak Antidote:通过稀疏表征调整平衡大模型安全与实用性
提出轻量级防御方法Jailbreak Antidote,在推理时仅调整约5%的内部状态沿安全方向偏移,在不增加推理延迟的情况下灵活抵御多种越狱攻击。
- 会议论文ICLR 2025
基于拒答特征对抗训练的鲁棒大语言模型防护
揭示对抗攻击通过消除残差流中的拒答特征来绕过模型护栏,提出拒答特征对抗训练(ReFAT),以低开销显著提升模型防对抗攻击的鲁棒性。
- 会议论文ICLR 2025
Wasserstein 分布鲁棒优化中可证明的鲁棒过拟合缓解
提出结合 Wasserstein 距离与 KL 散度的 Statistically Robust WDRO,给出鲁棒泛化界,实验显著缓解鲁棒过拟合并提升对抗鲁棒性。
- 会议论文ICLR 2025
扩散模型概念消除的最优目标选择与自适应引导
针对扩散模型通过消除概念降低有害内容生成风险时易影响无关概念的问题,提出自适应引导消除方法(AGE),动态选取最优目标概念以兼顾擦除效果与保真度。
- 会议论文ICLR 2025
对抗攻击下不确定性校准的可验证性研究
针对对抗扰动破坏模型校准的问题,提出可验证校准方法以给出最坏情况界限,并通过新型校准攻击与对抗校准训练提升模型校准能力。
- 会议论文ICLR 2025
基于自蒸馏的长尾对抗训练
提出一种自蒸馏长尾对抗训练方法,利用均衡自教师模型提升长尾分布下尾部类别的PGD对抗鲁棒性,并在多个数据集上取得领先表现。