全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
多模态语言模型对安全查询是否过度敏感?
构建MOSSBench基准,揭示多模态大模型在良性视觉刺激下的过度拒答现象,指出提升安全性的同时需兼顾保守与可用性。
- 会议论文ICLR 2025
精准、低成本且灵活:通过单向量消融缓解语言模型的错误拒答
针对语言模型将良性请求误判为有害的过度拒答问题,提出消融单个错误拒答向量的方法,无需重训即可有效降低错误拒答率并保留原有的安全与通用能力。
- 会议论文ICLR 2025
CLIPure:基于CLIP隐空间的对抗防御纯化方法
提出首个在CLIP多模态隐空间进行对抗纯化的防御方法CLIPure,无需额外训练即可高效抵御未知对抗攻击并大幅提升鲁棒性。
- 会议论文ICLR 2025
有动机的对手:对抗鲁棒性的策略性替代方案
把攻击者建模为追求自身目标而非单纯破坏分类器,提出 strategic training,利用对手动机的先验在不确定集内防御,减少过度保守。
- 会议论文ICLR 2025
SORRY-Bench:系统评测大语言模型的安全拒答
构建含 44 类不安全主题、440 条指令及 20 种语言变体的拒答基准,微调 7B 评判器可媲美 GPT-4,并评测 50 多个模型。
- 会议论文ICLR 2025
基于残差注意力门的文生图扩散模型概念精准擦除
提出 CPE,用非线性 Residual Attention Gate 擦除名人、画风和露骨内容等目标概念并保留其余概念,通过对抗训练提升对攻击提示的鲁棒性。
- 会议论文ICLR 2025
ASTrA:带自适应攻击的对抗式自监督训练
提出可学习的攻击策略网络,用对比损失奖励和 REINFORCE 自动发现攻击参数,在 CIFAR10/100、STL10 上取得最优的自监督对抗鲁棒性。
- 会议论文ICLR 2025
有界Levenshtein距离下的可验证鲁棒性
提出首个针对Levenshtein距离计算卷积分类器Lipschitz常数的方法LipsLev,能单次前向传播计算可验证半径并提升防御效率。
- 会议论文ICLR 2025
UniDetox:基于数据集蒸馏的大语言模型通用去毒化
提出基于对比解码的数据集蒸馏方法UniDetox,将去毒化表征提炼为合成文本,使通用去毒化微调无需针对各模型单独调优即可有效降低多种大语言模型的毒性。
- 会议论文ICLR 2025
视觉-语言适配如何影响视觉语言模型的安全性?
揭示视觉语言模型在多模态适配过程中存在内在安全能力退化现象,分析表明安全微调易导致过度拒答,进而提出通过模型权重合并兼顾模型安全性与有用性。
- 会议论文ICLR 2025
探究对抗训练中的遗忘:一种增强鲁棒性的新方法
发现对抗训练中存在类似持续学习的灾难性遗忘,提出 AMS 自蒸馏正则,提升 PGD、CW、AutoAttack 下的鲁棒准确率并缓解鲁棒过拟合。
- 会议论文ICLR 2025
奇妙的版权角色及如何(不)生成它们
评测显示图像和视频生成模型仅用通用关键词就可能生成版权角色,DALL·E 式提示改写不足,需配合负面提示等策略。
- 会议论文ICLR 2025
ADBM:用于可靠对抗净化的对抗扩散桥模型
提出对抗扩散桥模型ADBM,直接构建从加噪对抗样本到干净样本的反向桥,显著提升对抗净化防御能力。
- 会议论文ICLR 2025
分数遗忘蒸馏:扩散模型中快速无数据的机器遗忘方法
提出分数遗忘蒸馏方法SFD,通过将不安全概念的条件分数与安全概念对齐,在无需真实数据的情况下消除扩散模型中的有害生成内容。
- 会议论文ICLR 2025
SAFREE:用于安全文本到图像和视频生成的免训练自适应护栏
提出免训练护栏SAFREE,通过在文本嵌入空间规避毒性子空间并在扩散潜空间引入自适应重注意力,有效抑制文生图和视频中的不安全内容。
- 会议论文ICLR 2025
大语言模型能够成为强大的自我去毒者
提出轻量级受控解码算法SASA,仅利用LLM内部表征学习毒性子空间并动态调整采样策略,无需重训即可显著降低生成内容的毒性。
- 会议论文ICLR 2025
面向生成式图像模型的不可检测水印
提出首个不可检测的生成式图像模型水印方案,利用伪随机纠错码在不降低图像质量的前提下抵抗现有的水印去除攻击。
- 会议论文ICLR 2025
用于对抗鲁棒蒸馏的间接梯度匹配
提出间接梯度蒸馏模块IGDM,通过将学生的输入梯度与教师梯度间接匹配,显著提升小模型在AutoAttack评估下的对抗鲁棒性。
- 会议论文ICLR 2025
语义损失引导的高数据效率大模型安全响应监督微调
提出结合语义代价与负推土机距离损失的监督微调方法,仅需少量模型自身的有害响应即可引导其远离不安全输出,实现高效的安全训练并探讨了过度对齐问题。
- 会议论文ICLR 2025
ConceptPrune:基于关键神经元剪枝的扩散模型概念编辑
提出免训练的ConceptPrune方法,通过剪枝约0.12%的关键权重擦除裸露等不安全概念,有效防御白盒与黑盒对抗性越狱攻击。
- 会议论文ICLR 2025
可证明保护分类器免受OOD和对抗样本影响的方法
提出基于极值理论的SPADE方法,利用隐空间广义极值模型对分布外和对抗样本进行形式化表征与拒识,为分类器提供可证明的安全保护。
- 会议论文ICLR 2025
作为 DPO 稳健去噪变体的模型编辑:毒性消除案例研究
提出免微调的模型编辑方法 ProFS,通过识别并投影消除模型参数空间中的毒性子空间来降低模型毒性,在样本效率和抗噪性上优于 DPO。
- 会议论文ICLR 2025
AdvPaint:通过对抗性注意力扰动防御图像修复篡改
针对扩散模型被恶意用于图像修复篡改的威胁,提出 AdvPaint 防御框架,通过针对自注意力和交叉注意力的对抗扰动破坏语义交互,有效阻止未经授权的图像篡改。
- 会议论文ICLR 2025
超越Token分析:防御大模型社会工程攻击的超图度量空间框架
提出一种基于超图度量空间的LLM安全过滤方法,通过建模Token嵌入的几何结构与信息流差异区分良性与恶意提示,有效防御基于说服的社会工程越狱攻击。