全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
利用生长抑制剂抑制扩散模型中的不当图像概念
通过在图像空间注入生长抑制剂并结合自适应缩放Adapter,无需微调即可有效抑制由隐式不安全提示词诱导的NSFW等不当概念。
- 会议论文ICLR 2025
用于可靠内容审查的大语言模型护栏模型置信度校准研究
系统评估了 9 种护栏模型在内容审查中的置信度校准,发现其在越狱攻击下严重失校准,并验证了上下文校准等后处理方法提升护栏可靠性的有效性。
- 会议论文ICLR 2025
BlueSuffix:抵御越狱攻击的强化视觉语言模型蓝队防御
针对视觉语言模型的黑盒越狱攻击,提出包含视觉净化器、文本净化器和强化微调后缀生成器的蓝队防御方法BlueSuffix,大幅提升跨模态鲁棒性。
- 会议论文ICLR 2025
SafeWatch:具透明解释的高效安全策略遵循视频护栏模型
提出多模态视频护栏模型SafeWatch,通过并行编码安全策略与策略感知视觉Token剪枝,实现低开销且具备内容解释的零样本视频安全审核,并构建大规模评测基准。
- 会议论文ICLR 2025
HarmAug:用于安全护栏模型知识蒸馏的有效数据增强
提出通过越狱LLM生成多样化有害指令的数据增强方法HarmAug,在仅用少量计算成本下将大型安全护栏模型蒸馏至轻量级模型。
- 会议论文ICLR 2025
用于机器生成文本检测的深度核相对检验
用非参数核相对检验判断文本更接近人类还是机器分布,并优化核函数,相比双样本检验降低对人类文本的误判,优于现有检测器。
- 会议论文ICLR 2025
对抗鲁棒性评估的零成本代理
提出无需训练的 zero-cost proxy,基于对抗损失上界评估架构鲁棒性,比现有 robust NAS 快 20 倍以上。
- 会议论文ICML 2025
CAT:评估潜在扩散模型保护性扰动鲁棒性的对比对抗训练
指出对抗样本因扭曲潜在表示而起保护作用,并提出基于轻量 adapter 的 CAT 自适应攻击,显著削弱保护性扰动的效果,揭示其鲁棒性不足。
- 会议论文ICML 2025
相位与幅度感知提示以增强对抗鲁棒性
为每个类别构建相位级和幅度级提示,按鲁棒表现调整权重,测试时按预测标签选择提示,作为基于提示的对抗防御,实验验证有效。
- 会议论文ICML 2025
基于准则的安全推理
发现拒答训练难以泛化到 OOD 越狱,提出合成符合安全准则的推理监督来训练模型逐条推理,显著提升对 OOD 攻击的泛化。
- 会议论文ICML 2025
多模态对齐中对抗样本的拓扑特征
用持续同调分析 CLIP/BLIP 图文嵌入,发现对抗攻击会留下可识别的拓扑特征,并据此提出基于 MMD 检验的对抗样本检测方法。
- 会议论文ICML 2025
频域视角下的扩散式对抗净化
发现对抗扰动对幅度谱和相位谱的破坏随频率递增,据此在反向过程中替换低频成分,提出保留内容的净化方法,优于多数现有防御。
- 会议论文ICML 2025
OR-Bench:大语言模型过度拒答基准
提出自动生成过度拒答数据的方法,构建含 8 万条提示的 OR-Bench(含约 1000 条困难子集),并评测 8 个模型家族的 32 个主流 LLM 的过度拒答情况。
- 会议论文ICML 2025
基于随机平滑的可证明代价敏感对抗防御
针对不同误分类危害不同的场景,提出代价敏感认证半径与适配的认证算法及鲁棒训练方法,在不损失精度下提升认证的代价敏感鲁棒性。
- 会议论文ICML 2025
基于 LLM 改写器的鲁棒多比特文本水印
微调一对 LLM paraphraser 在句子层面嵌入多比特水印,小模型下检测 AUC 超 99.99%,对词替换和改写扰动保持鲁棒且难以察觉。
- 会议论文ICML 2025
解释内在维度在对抗训练中的作用
用流形猜想解释对抗训练在不同架构上的差异,提出 SMAAT,扰动内在维度最低的层,GPU 时间减少 25–33% 且鲁棒性显著提升。
- 会议论文ICML 2025
CASE-Bench:面向大语言模型的上下文感知安全基准
基于情境完整性理论构建带上下文的 LLM 安全基准,发现上下文显著影响人类判断,且商业模型在安全上下文下与人类判断存在明显偏差。
- 会议论文ICML 2025
为大语言模型学习安全约束
提出 Safety Polytope,在表示空间中学习多个安全约束,可检测不安全输入并通过几何 steering 纠正,降低对抗攻击成功率且保持通用能力。
- 会议论文ICML 2025
识别并理解对抗训练中的跨类别特征
从类别级特征归因角度研究对抗训练,发现跨类别特征有助于鲁棒分类,鲁棒过拟合时模型转向更多类别特有特征。
- 会议论文ICML 2025
WMarkGPT:用多模态大模型理解带水印图像
提出首个无需原图即可评估水印可见性并描述其位置、内容和语义影响的 MLLM,构建三个 VQA 数据集并采用三阶段训练,效果优于现有 MLLM。
- 会议论文ICML 2025
双目标优化改进 LLM 安全对齐
将 DPO 拆分为鲁棒拒答训练与有害知识定向遗忘两部分,显著提升模型对 prefilling、后缀和多轮等越狱攻击的鲁棒性。
- 会议论文ICML 2025
Confidential Guardian:用密码学手段防止模型弃权机制被滥用
提出人为压低置信度的 Mirage 攻击,并用校准分析加零知识证明的 Confidential Guardian 检测此类滥用。
- 会议论文ICML 2025
一图胜千言:保持可用性的文本-图像协同概念擦除框架
提出 Co-Erasing 框架,用文本提示及其诱发的不良图像共同描述目标概念,通过负向引导擦除有害概念,在擦除效果与可用性之间取得更好平衡。
- 会议论文ICML 2025
用共形预测增强对抗鲁棒性:保证模型可靠性的框架
提出 OPSA 攻击以最大化共形预测集大小,并据此设计 OPSA-AT 对抗训练,对多种攻击均提升鲁棒性且保持可靠预测。