全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2025
平均认证半径不是随机平滑的好指标
证明平均认证半径(ACR)作为随机平滑评估指标存在严重缺陷,现有训练策略提升 ACR 却降低难样本鲁棒性,并建议改用替代指标。
- 会议论文ICML 2025
当坏数据带来好模型
在毒性数据比例不同的 Olmo-1B 上发现,毒性数据越多,毒性的线性表示越解耦,后训练去毒(如 ITI)的效用权衡更好。
- 会议论文ICML 2025
恰到好处的偏移:用定向表示微调缓解对齐模型的过度拒答
提出 ACTOR,利用内部激活模式定位并调整触发拒答的成分,仅微调单层即可降低过度拒答,同时保持对有害请求的拒绝能力。
- 会议论文ICML 2025
概率近似全局鲁棒性认证
通过采样 ε-net 并调用局部鲁棒性 oracle,高效认证分类器对抗鲁棒性的概率松弛,所需样本量与输入维度、类别数和学习算法无关。
- 会议论文ICML 2025
LEVIS:神经网络的大型精确可验证输入空间
提出基于混合整数规划的验证框架,求出不存在对抗样本的大型可验证输入球及整体可验证区域,并通过互补约束优化将运行时间最多缩短 17 倍。
- 会议论文ICML 2025
通过对抗路径单纯形的闭式对齐提升 VLM 零样本对抗鲁棒性
针对 CLIP 类视觉语言模型的对抗样本,用泰勒展开推导闭式对齐损失做对抗微调,在 15 个数据集上取得领先的鲁棒性。
- 会议论文ICML 2025
SafetyAnalyst:可解释、透明、可调控的 AI 行为安全审核
用 CoT 生成 harm-benefit tree,再以 28 个可解释权重聚合成有害性分数,蒸馏出开源提示安全分类器,平均 F1 0.81,优于现有审核系统。
- 会议论文ICML 2025
图像质量守卫:针对图像质量指标对抗攻击的防御基准
系统评测 30 种防御策略,在自适应与非自适应设置下用 14 种攻击检验 9 个无参考 IQA 指标,并建立开放提交的基准。
- 会议论文ICML 2025
GaussMark:语言模型的结构化水印实用方法
基于高斯独立性检验把水印嵌入模型权重,生成无额外延迟、有统计保证,对扰动较鲁棒且几乎不损失模型质量。
- 会议论文ICML 2025
LlavaGuard:用于保护视觉数据集与模型的开源 VLM 安全护栏框架
构建带专家标注的多模态安全数据集,训练 0.5B 到 7B 的 VLM 安全护栏,在安全评估上优于现有护栏,并用于数据集标注和文生图审核。
- 会议论文ICML 2025
ProSec:用主动安全对齐加固代码大模型
基于 CWE 合成易诱发漏洞的编码场景并生成修复,用偏好学习训练,模型生成代码的安全性提升 25.2% 至 35.4%,且不损失效用。
- 会议论文ICML 2025
STAIR:通过内省式推理改进安全对齐
结合安全感知的思维链与 SI-MCTS 迭代偏好优化,并训练过程奖励模型,在缓解有害输出的同时保留有用性,测试时扩展后抵御越狱接近 Claude-3.5。
- 会议论文ICML 2025
ROME:基于信息瓶颈的鲁棒蒸馏数据集
利用信息瓶颈原理提升数据集蒸馏的对抗鲁棒性,在 CIFAR 上白盒和黑盒攻击下鲁棒性比率最高提升近 40%。
- 会议论文ICML 2025
面向随机对抗者的鲁棒多智能体强化学习
提出 ATSA,在线训练随机对抗者对观测与策略施加扰动,在星际争霸 II 和自动驾驶场景中提升多智能体对观测扰动的鲁棒性。
- 会议论文ICML 2025
现实中没有可靠性:已部署神经网络验证的挑战
证明理论可靠的验证器在浮点与部署环境下并不实际可靠,构造利用部署环境特征的对抗网络,成功欺骗所有被测验证器。
- 会议论文ICML 2025
优化专家混合模型的鲁棒性与准确率:双模型方法
分析发现 MoE 中专家网络比路由器更易受对抗攻击,据此提出针对性鲁棒训练与双模型线性组合策略,并给出可证明鲁棒性界。
- 会议论文ICML 2025
StealthInk:面向大语言模型的多比特隐蔽水印
提出保持原文本分布的多比特水印,可嵌入 userID、时间戳、modelID 等溯源信息,并给出检测所需 token 数下界。
- 会议论文ICML 2025
显式安全信号让安全对齐不再流于表面
指出现有对齐中安全信号被其他目标稀释,引入显式安全二分类任务并结合注意力与解码策略,以不足 0.2 倍开销显著增强对对抗攻击的抵抗力。
- 会议论文ICML 2025
用于提升鲁棒性的二次上界
推导对抗训练损失的二次上界(QUB)并用于快速对抗训练,显著提升鲁棒性,改进可能来自更平滑的损失曲面。
- 会议论文ICML 2025
Robust Secure Swap:屏蔽重点人物并可溯源的负责任换脸
换脸模型能拒绝对重点人物换脸,并为其他输出嵌入不可见水印以溯源,保护成功率 100%,水印提取准确率超 99%。
- 会议论文ICML 2025
两阶段 Learning-to-Defer 的对抗鲁棒性:算法与保证
首次研究两阶段 L2D 的对抗鲁棒性,提出破坏或操纵任务分配的攻击,并给出具一致性保证的防御算法 SARD。
- 会议论文ICML 2025
发现针对语言模型水印的伪造攻击
提出统计检验方法区分伪造与真实水印文本,发现学习型伪造方法都会留下可观测痕迹,检验功效高,说明现有伪造攻击效果不如此前认为。
- 会议论文ICML 2025
SEMU:基于奇异值分解的高效机器遗忘
用 SVD 构造低维投影,只修改少量参数且无需原训练数据即可选择性遗忘,以应对有害行为与安全监管需求。
- 会议论文ICML 2025
量化大语言模型的安全风险评估与量化感知安全修补
系统评测多种量化方法对 LLM 安全性的损害,并提出 Q-resafe 修补框架,使量化模型安全性恢复到量化前水平且尽量不损失效用。