全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
WMarkGPT:用多模态大模型理解带水印图像
提出首个无需原图即可评估水印可见性并描述其位置、内容和语义影响的 MLLM,构建三个 VQA 数据集并采用三阶段训练,效果优于现有 MLLM。
- 会议论文ICML 2025
双目标优化改进 LLM 安全对齐
将 DPO 拆分为鲁棒拒答训练与有害知识定向遗忘两部分,显著提升模型对 prefilling、后缀和多轮等越狱攻击的鲁棒性。
- 会议论文ICML 2025
Confidential Guardian:用密码学手段防止模型弃权机制被滥用
提出人为压低置信度的 Mirage 攻击,并用校准分析加零知识证明的 Confidential Guardian 检测此类滥用。
- 会议论文ICML 2025
一图胜千言:保持可用性的文本-图像协同概念擦除框架
提出 Co-Erasing 框架,用文本提示及其诱发的不良图像共同描述目标概念,通过负向引导擦除有害概念,在擦除效果与可用性之间取得更好平衡。
- 会议论文ICML 2025
用共形预测增强对抗鲁棒性:保证模型可靠性的框架
提出 OPSA 攻击以最大化共形预测集大小,并据此设计 OPSA-AT 对抗训练,对多种攻击均提升鲁棒性且保持可靠预测。
- 会议论文ICML 2025
自适应中值平滑:遗忘后文生图扩散模型的推理时对抗防御
将遗忘模型的鲁棒性重构为鲁棒回归问题,提出按 token 自适应调整噪声的中值平滑,在保持效用的同时提升对抗输入下的鲁棒性。
- 会议论文ICML 2025
Safe Delta:在多样数据集上微调 LLM 时持续保持安全性
针对微调服务破坏对齐的威胁,提出调整微调前后参数增量并加安全补偿向量的后训练防御,在四个数据集上保持安全且不损失效用。
- 会议论文ICML 2025
平均认证半径不是随机平滑的好指标
证明平均认证半径(ACR)作为随机平滑评估指标存在严重缺陷,现有训练策略提升 ACR 却降低难样本鲁棒性,并建议改用替代指标。
- 会议论文ICML 2025
当坏数据带来好模型
在毒性数据比例不同的 Olmo-1B 上发现,毒性数据越多,毒性的线性表示越解耦,后训练去毒(如 ITI)的效用权衡更好。
- 会议论文ICML 2025
恰到好处的偏移:用定向表示微调缓解对齐模型的过度拒答
提出 ACTOR,利用内部激活模式定位并调整触发拒答的成分,仅微调单层即可降低过度拒答,同时保持对有害请求的拒绝能力。
- 会议论文ICML 2025
概率近似全局鲁棒性认证
通过采样 ε-net 并调用局部鲁棒性 oracle,高效认证分类器对抗鲁棒性的概率松弛,所需样本量与输入维度、类别数和学习算法无关。
- 会议论文ICML 2025
LEVIS:神经网络的大型精确可验证输入空间
提出基于混合整数规划的验证框架,求出不存在对抗样本的大型可验证输入球及整体可验证区域,并通过互补约束优化将运行时间最多缩短 17 倍。
- 会议论文ICML 2025
通过对抗路径单纯形的闭式对齐提升 VLM 零样本对抗鲁棒性
针对 CLIP 类视觉语言模型的对抗样本,用泰勒展开推导闭式对齐损失做对抗微调,在 15 个数据集上取得领先的鲁棒性。
- 会议论文ICML 2025
SafetyAnalyst:可解释、透明、可调控的 AI 行为安全审核
用 CoT 生成 harm-benefit tree,再以 28 个可解释权重聚合成有害性分数,蒸馏出开源提示安全分类器,平均 F1 0.81,优于现有审核系统。
- 会议论文ICML 2025
图像质量守卫:针对图像质量指标对抗攻击的防御基准
系统评测 30 种防御策略,在自适应与非自适应设置下用 14 种攻击检验 9 个无参考 IQA 指标,并建立开放提交的基准。
- 会议论文ICML 2025
GaussMark:语言模型的结构化水印实用方法
基于高斯独立性检验把水印嵌入模型权重,生成无额外延迟、有统计保证,对扰动较鲁棒且几乎不损失模型质量。
- 会议论文ICML 2025
LlavaGuard:用于保护视觉数据集与模型的开源 VLM 安全护栏框架
构建带专家标注的多模态安全数据集,训练 0.5B 到 7B 的 VLM 安全护栏,在安全评估上优于现有护栏,并用于数据集标注和文生图审核。
- 会议论文ICML 2025
ProSec:用主动安全对齐加固代码大模型
基于 CWE 合成易诱发漏洞的编码场景并生成修复,用偏好学习训练,模型生成代码的安全性提升 25.2% 至 35.4%,且不损失效用。
- 会议论文ICML 2025
STAIR:通过内省式推理改进安全对齐
结合安全感知的思维链与 SI-MCTS 迭代偏好优化,并训练过程奖励模型,在缓解有害输出的同时保留有用性,测试时扩展后抵御越狱接近 Claude-3.5。
- 会议论文ICML 2025
ROME:基于信息瓶颈的鲁棒蒸馏数据集
利用信息瓶颈原理提升数据集蒸馏的对抗鲁棒性,在 CIFAR 上白盒和黑盒攻击下鲁棒性比率最高提升近 40%。
- 会议论文ICML 2025
面向随机对抗者的鲁棒多智能体强化学习
提出 ATSA,在线训练随机对抗者对观测与策略施加扰动,在星际争霸 II 和自动驾驶场景中提升多智能体对观测扰动的鲁棒性。
- 会议论文ICML 2025
现实中没有可靠性:已部署神经网络验证的挑战
证明理论可靠的验证器在浮点与部署环境下并不实际可靠,构造利用部署环境特征的对抗网络,成功欺骗所有被测验证器。
- 会议论文ICML 2025
优化专家混合模型的鲁棒性与准确率:双模型方法
分析发现 MoE 中专家网络比路由器更易受对抗攻击,据此提出针对性鲁棒训练与双模型线性组合策略,并给出可证明鲁棒性界。
- 会议论文ICML 2025
StealthInk:面向大语言模型的多比特隐蔽水印
提出保持原文本分布的多比特水印,可嵌入 userID、时间戳、modelID 等溯源信息,并给出检测所需 token 数下界。