全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ACM CCS 2025
UnsafeBench:在真实与 AI 生成图像上评测图像安全分类器
- 会议论文ACM CCS 2025
k 近邻的精确鲁棒性认证
- 会议论文ACM CCS 2025
加固深度神经网络二进制以抵御逆向工程攻击
- 会议论文ACM CCS 2025
面向加壳可执行文件检测的对抗鲁棒汇编语言模型
- 会议论文ACM CCS 2025
YouthSafe:面向青少年的 LLM 安全基准与防护模型
- 会议论文ACM CCS 2025
AI 生成内容隐空间水印的移除攻击与防御
- 会议论文ACM CCS 2025
从不完美标注的恶意软件数据中进行深度学习
- 会议论文ICLR 2025
动态神经堡垒:防御模型抽取的自适应护盾
提出动态神经堡垒防御方法DNF,利用动态早退网络使攻击查询在浅层随机退出,在保护网络架构与模型功能的同时显著降低计算成本。
- 会议论文ICLR 2025
大型视觉语言模型中的跨模态安全机制迁移
发现现有视觉语言对齐未能把文本安全机制迁移到图像,提出 TGA 文本引导对齐,无需视觉安全微调即可迁移安全机制并保持通用性能。
- 会议论文ICLR 2025
抵御通用对抗扰动的民主化训练
针对通用对抗扰动导致的隐层异常熵谱,提出基于熵增强的民主化训练方法,在保持模型干净样本准确率的同时显著降低攻击成功率并提升鲁棒性。
- 会议论文ICLR 2025
安全对齐不应仅仅停留在前几个Token深度
揭示当前安全对齐只改变前几个输出token的“浅层对齐”缺陷,指出这是导致越狱易受攻击的根源,并提出加深对齐深度与正则化微调防御。
- 会议论文ICLR 2025
DiffusionGuard:防御扩散模型恶意图像编辑的鲁棒方案
提出DiffusionGuard防御框架,通过针对扩散过程早期阶段生成对抗噪声并引入掩码增强,有效抵御基于掩码等复杂场景下的未授权扩散图像编辑与隐私威胁。
- 会议论文ICLR 2025
用稀疏多项式优化验证二值神经网络的性质
用稀疏多项式优化的半定规划松弛验证 BNN 对 ℓ∞ 和 ℓ2 对抗攻击的鲁棒性,提升验证可扩展性。
- 会议论文ICLR 2025
回溯机制提升大语言模型文本生成安全性
提出通过引入RESET特殊标记让模型撤回自身不安全生成的回溯技术,可融入SFT或DPO训练,大幅提升模型安全性并抵御自适应攻击。
- 会议论文ICLR 2025
$R^2$-Guard:基于知识增强逻辑推理的鲁棒大模型安全护栏
提出结合数据驱动模型与概率图模型逻辑推理的安全护栏R^2-Guard,显式建模安全类别间关联,在内容审核与防御越狱攻击上显著超越现有护栏。
- 会议论文ICLR 2025
论大语言模型的持续机器遗忘
提出包含正交LoRA与分布外检测器的O3框架,在无需保留历史数据的情况下实现大模型的持续遗忘并保持模型效用。
- 会议论文ICLR 2025
LLM 的领域认证:限制越域输出
提出 domain certification 概念和 VALID 方法,为受限领域部署的 LLM 在对抗条件下的越域输出提供可证明的上界,并在多个数据集上验证。
- 会议论文ICLR 2025
SaLoRA:保持安全对齐的低秩适配
分析 LoRA 微调如何破坏安全对齐相关特征,提出基于安全数据的固定安全模块与任务初始化,使微调不破坏原有对齐,效果优于其他适配器方法。
- 会议论文ICLR 2025
BingoGuard:具备风险等级的大语言模型内容审核工具
提出包含11类有害话题严重程度细则的BingoGuard内容审核系统,可同时预测二元安全标签与风险等级并在基准上达SOTA。
- 会议论文ICLR 2025
应对对抗可迁移性:一种基于傅里叶变换的集成训练新方法
提出基于弱点分配策略的傅里叶数据变换方法,通过多样化非鲁棒特征有效防御对抗样本的可迁移性攻击。
- 会议论文ICLR 2025
RobustKV:通过KV驱逐防御大语言模型越狱攻击
提出RobustKV防御框架,通过从键值缓存中选择性驱逐有害查询的关键标记,在保留良性性能的同时有效抵御对抗提示越狱攻击。
- 会议论文ICLR 2025
重新审视对抗训练中的不变性正则以改善鲁棒性与精度权衡
指出不变性正则存在梯度冲突和混合分布问题,提出 ARAT(非对称不变性损失加 split-BN),在多种设置下优于现有对抗防御。
- 会议论文ICLR 2025
从文生图扩散模型中消除概念组合
针对良性概念组合仍可能诱发不当主题图像的安全隐患,提出概念组合消除框架CoGFD,通过解耦共现高层特征消除不良概念组合,同时维持单个概念的生成质量。
- 会议论文ICLR 2025
赋予视觉重编程对抗鲁棒性
研究视觉重编程在对抗攻击下的鲁棒性问题,发现采用具对抗鲁棒性的预训练模型并在重编程中引入目标任务对抗样本可显著提升重编程模型的对抗鲁棒性。