全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
基于拒答特征对抗训练的鲁棒大语言模型防护
揭示对抗攻击通过消除残差流中的拒答特征来绕过模型护栏,提出拒答特征对抗训练(ReFAT),以低开销显著提升模型防对抗攻击的鲁棒性。
- 会议论文ICLR 2025
Wasserstein 分布鲁棒优化中可证明的鲁棒过拟合缓解
提出结合 Wasserstein 距离与 KL 散度的 Statistically Robust WDRO,给出鲁棒泛化界,实验显著缓解鲁棒过拟合并提升对抗鲁棒性。
- 会议论文ICLR 2025
扩散模型概念消除的最优目标选择与自适应引导
针对扩散模型通过消除概念降低有害内容生成风险时易影响无关概念的问题,提出自适应引导消除方法(AGE),动态选取最优目标概念以兼顾擦除效果与保真度。
- 会议论文ICLR 2025
对抗攻击下不确定性校准的可验证性研究
针对对抗扰动破坏模型校准的问题,提出可验证校准方法以给出最坏情况界限,并通过新型校准攻击与对抗校准训练提升模型校准能力。
- 会议论文ICLR 2025
基于自蒸馏的长尾对抗训练
提出一种自蒸馏长尾对抗训练方法,利用均衡自教师模型提升长尾分布下尾部类别的PGD对抗鲁棒性,并在多个数据集上取得领先表现。
- 会议论文ICLR 2025
利用生长抑制剂抑制扩散模型中的不当图像概念
通过在图像空间注入生长抑制剂并结合自适应缩放Adapter,无需微调即可有效抑制由隐式不安全提示词诱导的NSFW等不当概念。
- 会议论文ICLR 2025
用于可靠内容审查的大语言模型护栏模型置信度校准研究
系统评估了 9 种护栏模型在内容审查中的置信度校准,发现其在越狱攻击下严重失校准,并验证了上下文校准等后处理方法提升护栏可靠性的有效性。
- 会议论文ICLR 2025
BlueSuffix:抵御越狱攻击的强化视觉语言模型蓝队防御
针对视觉语言模型的黑盒越狱攻击,提出包含视觉净化器、文本净化器和强化微调后缀生成器的蓝队防御方法BlueSuffix,大幅提升跨模态鲁棒性。
- 会议论文ICLR 2025
SafeWatch:具透明解释的高效安全策略遵循视频护栏模型
提出多模态视频护栏模型SafeWatch,通过并行编码安全策略与策略感知视觉Token剪枝,实现低开销且具备内容解释的零样本视频安全审核,并构建大规模评测基准。
- 会议论文ICLR 2025
HarmAug:用于安全护栏模型知识蒸馏的有效数据增强
提出通过越狱LLM生成多样化有害指令的数据增强方法HarmAug,在仅用少量计算成本下将大型安全护栏模型蒸馏至轻量级模型。
- 会议论文ICLR 2025
用于机器生成文本检测的深度核相对检验
用非参数核相对检验判断文本更接近人类还是机器分布,并优化核函数,相比双样本检验降低对人类文本的误判,优于现有检测器。
- 会议论文ICLR 2025
对抗鲁棒性评估的零成本代理
提出无需训练的 zero-cost proxy,基于对抗损失上界评估架构鲁棒性,比现有 robust NAS 快 20 倍以上。
- 会议论文ICML 2025
CAT:评估潜在扩散模型保护性扰动鲁棒性的对比对抗训练
指出对抗样本因扭曲潜在表示而起保护作用,并提出基于轻量 adapter 的 CAT 自适应攻击,显著削弱保护性扰动的效果,揭示其鲁棒性不足。
- 会议论文ICML 2025
相位与幅度感知提示以增强对抗鲁棒性
为每个类别构建相位级和幅度级提示,按鲁棒表现调整权重,测试时按预测标签选择提示,作为基于提示的对抗防御,实验验证有效。
- 会议论文ICML 2025
基于准则的安全推理
发现拒答训练难以泛化到 OOD 越狱,提出合成符合安全准则的推理监督来训练模型逐条推理,显著提升对 OOD 攻击的泛化。
- 会议论文ICML 2025
多模态对齐中对抗样本的拓扑特征
用持续同调分析 CLIP/BLIP 图文嵌入,发现对抗攻击会留下可识别的拓扑特征,并据此提出基于 MMD 检验的对抗样本检测方法。
- 会议论文ICML 2025
频域视角下的扩散式对抗净化
发现对抗扰动对幅度谱和相位谱的破坏随频率递增,据此在反向过程中替换低频成分,提出保留内容的净化方法,优于多数现有防御。
- 会议论文ICML 2025
OR-Bench:大语言模型过度拒答基准
提出自动生成过度拒答数据的方法,构建含 8 万条提示的 OR-Bench(含约 1000 条困难子集),并评测 8 个模型家族的 32 个主流 LLM 的过度拒答情况。
- 会议论文ICML 2025
基于随机平滑的可证明代价敏感对抗防御
针对不同误分类危害不同的场景,提出代价敏感认证半径与适配的认证算法及鲁棒训练方法,在不损失精度下提升认证的代价敏感鲁棒性。
- 会议论文ICML 2025
基于 LLM 改写器的鲁棒多比特文本水印
微调一对 LLM paraphraser 在句子层面嵌入多比特水印,小模型下检测 AUC 超 99.99%,对词替换和改写扰动保持鲁棒且难以察觉。
- 会议论文ICML 2025
解释内在维度在对抗训练中的作用
用流形猜想解释对抗训练在不同架构上的差异,提出 SMAAT,扰动内在维度最低的层,GPU 时间减少 25–33% 且鲁棒性显著提升。
- 会议论文ICML 2025
CASE-Bench:面向大语言模型的上下文感知安全基准
基于情境完整性理论构建带上下文的 LLM 安全基准,发现上下文显著影响人类判断,且商业模型在安全上下文下与人类判断存在明显偏差。
- 会议论文ICML 2025
为大语言模型学习安全约束
提出 Safety Polytope,在表示空间中学习多个安全约束,可检测不安全输入并通过几何 steering 纠正,降低对抗攻击成功率且保持通用能力。
- 会议论文ICML 2025
识别并理解对抗训练中的跨类别特征
从类别级特征归因角度研究对抗训练,发现跨类别特征有助于鲁棒分类,鲁棒过拟合时模型转向更多类别特有特征。