全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
留意 LLM 遗忘学习:隐藏风险与对策
揭示基于微调的遗忘学习可被恶意遗忘请求隐蔽破坏良性用户体验,并提出 Scope-aware Unlearning 增强鲁棒性。
- 会议论文NeurIPS 2025
随机分配带来的隐私放大
给出随机 k-out-of-t 分配采样方案的首个理论隐私保证与数值估计算法,其保证可由 Poisson 子采样的保证上界。
- 会议论文NeurIPS 2025
GeoClip:差分隐私 SGD 的几何感知裁剪
提出 GeoClip,在与梯度分布几何对齐的变换基下裁剪并加噪,无需额外隐私开销,给出收敛保证,在相同隐私预算下优于现有自适应裁剪方法。
- 会议论文NeurIPS 2025
ICLScan:通过定向上下文学习检测黑盒大语言模型中的后门
发现已含后门的 LLM 极易经 ICL 植入新触发器,据此仅靠多次查询统计成功率即可检测黑盒后门,各项指标接近 1。
- 会议论文NeurIPS 2025
从语言模型中擦除概念知识
提出 ELM,用模型自身的内省分类能力做低秩更新,在生物安全、网络安全等领域擦除目标概念,同时保持通用能力,并对对抗攻击保持较强鲁棒性。
- 会议论文NeurIPS 2025
通过参数与表示扰动实现共识鲁棒的迁移攻击
将迁移攻击建模为共识鲁棒优化,提出 CORTA,在单一代理模型下对 CNN 与 ViT 目标迁移成功率比最佳既有方法高 19.1 个百分点。
- 会议论文NeurIPS 2025
MixAT:结合连续与离散对抗训练的 LLM 防御
结合更强的离散攻击与更快的连续攻击做对抗训练,最坏情况攻击成功率(ALO-ASR)低于 20%,优于先前防御的 50% 以上,且开销相近。
- 会议论文NeurIPS 2025
医疗基础模型的记忆化风险调查
提出一套黑盒评测,在嵌入和生成层面探测基于 EHR 的基础模型对患者信息的记忆,并开源工具包。
- 会议论文NeurIPS 2025
水印、可迁移攻击与对抗防御的元分析
形式化基于后门的水印与对抗防御的权衡,证明任一学习任务中水印、对抗防御、可迁移攻击至少存在其一,并用全同态加密构造可迁移攻击。
- 会议论文NeurIPS 2025
压缩的代价:针对 ℓ2 范数估计 Sketch 的紧二次黑盒攻击
提出通用非自适应黑盒攻击,用约 k² 次查询使任意线性 sketch 的范数估计失效,下界与已知上界匹配,并与图像分类对抗攻击相通。
- 会议论文NeurIPS 2025
ToxicTextCLIP:针对 CLIP 预训练的文本投毒与后门攻击
生成背景一致的对抗文本投毒 CLIP 预训练,投毒成功率最高 95.83%,后门 Hit@1 达 98.68%,并绕过多种防御。
- 会议论文NeurIPS 2025
Safe RLHF-V:基于多模态人类反馈的安全强化学习
提出首个多模态安全对齐框架,含双偏好数据集 BeaverTails-V 与护栏模型;约束优化使模型安全性提升 34.2%、有用性提升 34.3%。
- 会议论文NeurIPS 2025
通过对手偏好对齐增强基于扩散模型的无限制对抗攻击
把无限制对抗样本生成视为对手偏好对齐问题,两阶段 APA 框架在保持视觉一致性的同时显著提升黑盒攻击迁移性。
- 会议论文NeurIPS 2025
OpenGU:图遗忘学习综合基准
提出首个图遗忘基准 OpenGU,整合 16 种算法、37 个数据集和 13 种 GNN 骨干,得出 10 条关于现有方法局限的结论。
- 会议论文NeurIPS 2025
Shape it Up!在微调中恢复 LLM 安全性
提出动态安全塑形 DSS,用护栏模型逐段评估回复的 STAR 信号,强化安全片段、抑制不安全内容,降低微调风险且不损失能力。
- 会议论文NeurIPS 2025
欧几里得 Jordan 代数的差分隐私及其在私有对称锥规划中的应用
为输出位于欧几里得 Jordan 代数的函数设计通用高斯机制,并给出私有对称锥规划与半定规划算法,解决了一个公开问题。
- 会议论文NeurIPS 2025
能否从 LLM 推断训练数据的机密属性?
提出 PropInfer 基准及提示生成攻击与影子模型攻击,在微调 LLM 上成功推断数据集级敏感属性。
- 会议论文NeurIPS 2025
ImageSentinel:保护视觉数据集免受未授权检索增强图像生成
合成与原数据集视觉一致的哨兵图像,以随机字符序列作检索密钥,可检测 RAIG 系统对私有图像数据集的未授权使用,且不损害授权生成质量。
- 会议论文NeurIPS 2025
通过仅查询交互对 LLM Agent 实施记忆注入攻击
MINJA 无需直接修改记忆库,仅通过查询与观察输出就向 Agent 记忆注入恶意记录,在多种 Agent 上有效。
- 会议论文NeurIPS 2025
实用的贝叶斯最优成员推断攻击
推导 GNN 节点级成员推断的贝叶斯最优规则,提出 BASE 与 G-BASE,性能匹配或超过 LiRA、RMIA 且计算成本更低。
- 会议论文NeurIPS 2025
面向扩散模型安全使用的免训练安全去噪器
利用负例集合直接修改采样轨迹,让生成远离不安全、受版权或隐私数据区域,无需重训,在 CoPro 上达到领先安全表现。
- 会议论文NeurIPS 2025
Learning to Steer:面向多模态 LLM 的输入相关 steering
训练小型辅助模块预测输入相关的 steering 向量,在多模态 LLM 上减少幻觉并强化安全行为,优于静态 steering 基线。
- 会议论文NeurIPS 2025
对 LLM 的病毒感染攻击:投毒经合成数据传播
发现合成数据训练范式对现有投毒与后门攻击有较强抵抗力,提出 VIA 框架,使攻击即使在干净查询下也能经合成数据传播,下游攻击成功率接近上游。
- 会议论文NeurIPS 2025
AdvPrefix:面向细腻 LLM 越狱的目标函数
提出可即插即用的前缀强制目标,按预填充攻击成功率与负对数似然选择模型相关前缀;将 GCG 默认前缀替换后,Llama-3 上细腻攻击成功率从 14% 升至 80%。