全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICLR 2025
利用目标攻击提升防范未授权扩散模型定制的保护效果
提出通过目标攻击向图像添加保护性水印并投毒扩散模型的方法,显著优于传统非目标攻击,能有效破坏未授权定制生成的图像质量以保护数据版权。
- 会议论文ICLR 2025
图神经网络抵御标签投毒的精确鲁棒性认证
利用神经正切核将双层优化问题转化为混合整数线性规划,首次提出了针对神经网络标签翻转投毒攻击的精确鲁棒性认证方法。
- 会议论文ICLR 2025
通过安全感知子空间缓解多任务模型合并中的后门效应
发现模型合并存在后门继承与转移问题,提出 DAM,用双掩码选出共享且安全的子空间,攻击成功率降低 2-10 个百分点,精度仅损失约 1%。
- 会议论文ICLR 2025
BadJudge:LLM裁判机制中的后门脆弱性
揭示针对LLM裁判机制的后门攻击威胁,仅投毒少量数据即可操纵护栏误判毒性输入,并提出利用模型合并有效消除后门。
- 会议论文ICLR 2025
通过因果推断实现“心智控制”:从投毒数据预测干净图像
从因果视角提出 MCCI,同时利用图像与攻击指示符端到端训练,从投毒数据中得到干净模型,并能恢复被投毒样本的正确预测。
- 会议论文ICLR 2025
面对数据投毒时具备可证明可靠性的共形预测集
针对训练和校准数据投毒攻击,提出首个具备可证明可靠性保证的共形预测集方法RPS,通过平滑评分与多数投票聚合削弱投毒影响,并维持干净数据的覆盖率。
- 会议论文ICLR 2025
抵御多重并发数据投毒攻击的后门防御方法
揭示了现有后门防御难以抵御多重并发数据投毒的问题,并提出基于损失动态的检测方法BaDLoss,有效降低了多攻击场景下的攻击成功率。
- 会议论文ICLR 2025
大语言模型联邦指令微调中的新兴安全攻击与防御
揭示联邦指令微调中安全对齐易受投毒攻击的脆弱性,提出恶意客户端自动生成攻击数据破坏安全对齐的方法,并提出自动生成防御数据的事后微调防御方案。
- 会议论文ICLR 2025
利用分布外数据对视觉语言模型植入后门
提出VLOOD方法,在无需访问原始训练数据的情况下,仅利用分布外数据成功对视觉语言模型实现后门注入,揭示多模态模型的安全漏洞。
- 会议论文ICLR 2025
基于鲁棒性的图神经网络后门防御
利用删边下的预测方差识别投毒节点,提出结合随机删边检测与鲁棒训练的框架RIGBD,有效抵御多种不同特性的图后门攻击。
- 会议论文ICML 2025
MixBridge:基于混合薛定谔桥的异构图像到图像后门攻击
在桥式扩散模型中植入多个异构后门触发器,用 Divide-and-Merge 策略解决多后门冲突,并设计权重重分配方案提升隐蔽性。
- 会议论文ICML 2025
基于对比提示的测试时多模态后门检测
发现后门图像表示对类别描述文本的变化不敏感,据此提出 BDetCLIP,在推理阶段用良性与恶性描述文本的相似度分布差异检测 CLIP 后门样本。
- 会议论文ICML 2025
PoisonBench:评估语言模型对偏好数据投毒的脆弱性
提出评测基准,在 8 个场景下测试 22 个模型对偏好学习阶段数据投毒的敏感度,发现投毒效果与投毒比例呈对数线性关系,且可泛化到未见触发词。
- 会议论文ICML 2025
PoisonedEye:针对检索增强视觉语言模型的知识投毒攻击
首个针对 VLRAG 系统的知识投毒攻击,只需向知识库注入一个毒样本即可操纵目标查询的回答,并扩展到整类查询。
- 会议论文ICML 2025
深入审视针对 CLIP 的后门攻击
通过表示分解分析后门对 CLIP 各组件的影响,发现局部补丁攻击主要影响注意力头、全局扰动攻击主要影响 MLP,并据此设计推理阶段防御。
- 会议论文ICML 2025
双视角分割防御:无需干净种子的后门安全
提出 BSD,结合语义与损失统计特征分割干净样本,无需额外干净数据,平均防御有效性评分比现有防御高出 20% 以上。
- 会议论文ICML 2025
通过数据特定不可区分性实现可信机器学习
提出 Data-Specific Indistinguishability 框架,用最优多元高斯机制为记忆、数据投毒和版权提供可证明保证,并在记忆缓解、后门防御和版权保护上验证有效。
- 会议论文ICML 2025
SPMC:基于边际贡献的自净化联邦后门防御
利用客户端间一致性估计边际贡献并降低异常客户端影响,再本地修正可疑梯度,在不损失正常精度下防御复杂后门攻击。
- 会议论文ICML 2025
知识密集领域中应用 RAG 的脆弱性
在医疗问答中展示检索系统易受通用投毒攻击,攻击者可注入含 PII 等目标信息的文档,并提出基于检测的防御。
- 会议论文ICML 2025
对抗性策展数据下的自消耗生成模型
理论分析自消耗再训练循环在噪声和对抗性数据策展下的稳定条件,并设计攻击算法,让竞争平台用恶意用户使对手模型偏离真实用户偏好。
- 会议论文ICML 2025
注意力机制 token 选择中的后门攻击
从理论上分析利用注意力 token 选择的后门攻击,证明单头自注意力 Transformer 可拟合投毒数据,并刻画触发器强度条件,在合成数据上验证。
- 会议论文ICML 2025
CROW:通过内部一致性正则化清除 LLM 后门
利用后门模型被触发时层间隐状态不稳定的现象,微调时施加层间一致性正则,无需触发词知识即可显著降低多种后门攻击成功率。
- 会议论文ICML 2025
针对机器遗忘的灵活、高效、稳定的对抗攻击
提出 DDPA 攻击,通过凸多面体近似与正则单纯形检测,针对恶意遗忘请求实现更灵活、高效、稳定的攻击,并在真实数据集上与现有遗忘攻击比较。
- 会议论文ICML 2025
通过权重对称性绕开后门空间
提出 TSC 后门净化防御,利用置换不变性与二次模式连通性放大投毒样本损失,只需少量干净样本,并可推广到 SimCLR、CLIP。