全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
医疗基础模型的记忆化风险调查
提出一套黑盒评测,在嵌入和生成层面探测基于 EHR 的基础模型对患者信息的记忆,并开源工具包。
- 会议论文NeurIPS 2025
水印、可迁移攻击与对抗防御的元分析
形式化基于后门的水印与对抗防御的权衡,证明任一学习任务中水印、对抗防御、可迁移攻击至少存在其一,并用全同态加密构造可迁移攻击。
- 会议论文NeurIPS 2025
压缩的代价:针对 ℓ2 范数估计 Sketch 的紧二次黑盒攻击
提出通用非自适应黑盒攻击,用约 k² 次查询使任意线性 sketch 的范数估计失效,下界与已知上界匹配,并与图像分类对抗攻击相通。
- 会议论文NeurIPS 2025
ToxicTextCLIP:针对 CLIP 预训练的文本投毒与后门攻击
生成背景一致的对抗文本投毒 CLIP 预训练,投毒成功率最高 95.83%,后门 Hit@1 达 98.68%,并绕过多种防御。
- 会议论文NeurIPS 2025
Safe RLHF-V:基于多模态人类反馈的安全强化学习
提出首个多模态安全对齐框架,含双偏好数据集 BeaverTails-V 与护栏模型;约束优化使模型安全性提升 34.2%、有用性提升 34.3%。
- 会议论文NeurIPS 2025
通过对手偏好对齐增强基于扩散模型的无限制对抗攻击
把无限制对抗样本生成视为对手偏好对齐问题,两阶段 APA 框架在保持视觉一致性的同时显著提升黑盒攻击迁移性。
- 会议论文NeurIPS 2025
OpenGU:图遗忘学习综合基准
提出首个图遗忘基准 OpenGU,整合 16 种算法、37 个数据集和 13 种 GNN 骨干,得出 10 条关于现有方法局限的结论。
- 会议论文NeurIPS 2025
Shape it Up!在微调中恢复 LLM 安全性
提出动态安全塑形 DSS,用护栏模型逐段评估回复的 STAR 信号,强化安全片段、抑制不安全内容,降低微调风险且不损失能力。
- 会议论文NeurIPS 2025
欧几里得 Jordan 代数的差分隐私及其在私有对称锥规划中的应用
为输出位于欧几里得 Jordan 代数的函数设计通用高斯机制,并给出私有对称锥规划与半定规划算法,解决了一个公开问题。
- 会议论文NeurIPS 2025
能否从 LLM 推断训练数据的机密属性?
提出 PropInfer 基准及提示生成攻击与影子模型攻击,在微调 LLM 上成功推断数据集级敏感属性。
- 会议论文NeurIPS 2025
ImageSentinel:保护视觉数据集免受未授权检索增强图像生成
合成与原数据集视觉一致的哨兵图像,以随机字符序列作检索密钥,可检测 RAIG 系统对私有图像数据集的未授权使用,且不损害授权生成质量。
- 会议论文NeurIPS 2025
通过仅查询交互对 LLM Agent 实施记忆注入攻击
MINJA 无需直接修改记忆库,仅通过查询与观察输出就向 Agent 记忆注入恶意记录,在多种 Agent 上有效。
- 会议论文NeurIPS 2025
实用的贝叶斯最优成员推断攻击
推导 GNN 节点级成员推断的贝叶斯最优规则,提出 BASE 与 G-BASE,性能匹配或超过 LiRA、RMIA 且计算成本更低。
- 会议论文NeurIPS 2025
面向扩散模型安全使用的免训练安全去噪器
利用负例集合直接修改采样轨迹,让生成远离不安全、受版权或隐私数据区域,无需重训,在 CoPro 上达到领先安全表现。
- 会议论文NeurIPS 2025
Learning to Steer:面向多模态 LLM 的输入相关 steering
训练小型辅助模块预测输入相关的 steering 向量,在多模态 LLM 上减少幻觉并强化安全行为,优于静态 steering 基线。
- 会议论文NeurIPS 2025
对 LLM 的病毒感染攻击:投毒经合成数据传播
发现合成数据训练范式对现有投毒与后门攻击有较强抵抗力,提出 VIA 框架,使攻击即使在干净查询下也能经合成数据传播,下游攻击成功率接近上游。
- 会议论文NeurIPS 2025
AdvPrefix:面向细腻 LLM 越狱的目标函数
提出可即插即用的前缀强制目标,按预填充攻击成功率与负对数似然选择模型相关前缀;将 GCG 默认前缀替换后,Llama-3 上细腻攻击成功率从 14% 升至 80%。
- 会议论文NeurIPS 2025
用信息量更大的触发器提升神经网络指纹的唯一性
从信息论角度研究黑盒模型指纹,选取边际互信息最大的触发器,使版权溯源更准确高效,并可接入现有指纹方案。
- 会议论文NeurIPS 2025
超越期望:面向风险校准语言模型的分位数引导对齐
提出 Quantile-Guided Alignment,在 RLHF 中施加分位数约束以控制有害输出等尾部风险,在对话和代码生成上提升目标尾部质量。
- 会议论文NeurIPS 2025
度量并引导单义性:Guided Sparse Autoencoders
提出特征单义性分数 FMS 与带概念标签训练的 G-SAE,在毒性检测、隐私属性识别等任务上提升单义性,并实现更精细的 steering。
- 会议论文NeurIPS 2025
增强 LLM 水印对擦除与伪造攻击的双重鲁棒性
提出 SEEK 水印方案,借助等价纹理密钥让窗口内多个 token 独立支持检测,在不牺牲抗伪造能力的同时提升对擦除攻击的鲁棒性。
- 会议论文NeurIPS 2025
IMPACT:基于两阶段优化的不规则多补丁对抗组合
提出无梯度的对抗补丁攻击框架,联合优化补丁形状、位置、数量与内容,并生成连续不规则补丁,效果优于多种现有方法。
- 会议论文NeurIPS 2025
基于类比的多轮 LLM 越狱
先用良性任务让模型学会目标响应结构,再在最后一轮做受控语义替换,在六个模型上平均攻击成功率 93.3%。
- 会议论文NeurIPS 2025
数据集属性对深度迁移学习成员推断脆弱性的影响
理论与实证分析微调模型的 MIA 脆弱性,发现攻击者优势随每类样本数按幂律下降,但保护最脆弱样本所需数据量仍非常大。