全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
自回归图像生成的水印
首次在 token 层面为自回归图像模型加水印,通过微调 tokenizer 改善反向循环一致性并加同步层,对图像变换与移除攻击保持鲁棒。
- 会议论文NeurIPS 2025
BackdoorDM:扩散模型后门学习的综合基准
首个扩散模型后门基准,包含 9 种攻击、4 种防御和可视化工具,并提出基于 MLLM 的统一评测方法。
- 会议论文NeurIPS 2025
RULE:强化遗忘实现遗忘与保留的帕累托最优
把 LLM 遗忘建模为拒答边界优化,用可验证奖励训练,仅用少量遗忘数据即在遗忘质量和自然度上超过基线。
- 会议论文NeurIPS 2025
RSafe:以主动推理构建鲁棒自适应的 LLM 护栏
先做策略引导的安全推理,再用规则式 RL 对齐推理路径,在未见有害类别与越狱攻击上泛化更好,并给出可读解释。
- 会议论文NeurIPS 2025
用强化学习逆向工程人类偏好
用 judge-LLM 的信号作为奖励,对抗式训练生成前置文本的模型,使冻结 LLM 获得更高评测分且几乎无法被察觉,并可迁移到未见的模型。
- 会议论文NeurIPS 2025
语言模型能预测自身行为
基于输入表示训练带 conformal 保证的探针,在生成前预警越狱等对齐失效,预警系统使越狱减少 91%。
- 会议论文NeurIPS 2025
AegisGuard:RL 引导的适配器调优,实现基于 TEE 的高效安全端侧推理
用 RL 排序对模型窃取敏感的 LoRA 适配器,仅将其放入 TEE 并压缩,窃取抵抗与全屏蔽相当,延迟降低 2–3 倍。
- 会议论文NeurIPS 2025
面向扩散模型的抗下游微调的安全遗忘
发现现有安全遗忘方法在良性数据微调后会失效,提出 ResAlign,通过隐式优化建模和元学习,使安全性在微调后仍得以保持。
- 会议论文NeurIPS 2025
用测谎器做偏好学习:可能诱导诚实,也可能诱导规避
把测谎器放进 LLM 后训练的标注环节:GRPO 可学出规避测谎器的策略(欺骗率超 85%),但测谎器 TPR 或 KL 正则足够高时可得诚实策略,DPO 欺骗率低于 25%。
- 会议论文NeurIPS 2025
Vid-SME:针对大型视频理解模型的成员推断攻击
提出首个面向视频理解 LLM 的成员推断方法,利用正常与时间反转帧的 Sharma–Mittal 熵差异判断视频是否在训练集中。
- 会议论文NeurIPS 2025
基于时序逻辑的多车后门攻击:针对端到端自动驾驶离线 RL 智能体
以其他车辆轨迹为触发器,用时序逻辑生成触发轨迹并加入负训练,在 5 个离线 RL 驾驶智能体上验证了攻击的灵活性与有效性。
- 会议论文NeurIPS 2025
EraseFlow:基于 GFlowNet 对齐学习概念擦除策略
把文生图的概念擦除视为去噪路径探索,用 GFlowNet 学习策略,在移除有害概念的同时保持生成质量。
- 会议论文NeurIPS 2025
AdvEDM:针对基于 VLM 的具身智能体的细粒度对抗攻击
只改变少数关键物体的感知并保留其余语义,使 VLM 输出有效但错误的决策,在通用和具身决策任务中攻击效果好。
- 会议论文NeurIPS 2025
RepGuard:大语言模型后门防御的自适应特征解耦
通过局部一致性与样本偏差定位可疑后门特征,并自适应掩码解耦,无需知道触发器;在目标拒答与越狱任务上平均将攻击成功率降低近 80%。
- 会议论文NeurIPS 2025
安全 + 安全 = 不安全?利用安全图像越狱大型视觉语言模型
提出 Safety Snowball Agent,借助 LVLM 的通用推理与安全滚雪球效应,用几乎任意图像逐步诱导有害输出,对最新 LVLM 越狱成功率高。
- 会议论文NeurIPS 2025
可解释的 RLHF:改进对齐
通过定位导致不满意回复的训练数据并对其进行遗忘,在不显著损害其他回复的前提下改进 RLHF 对齐后的语言模型。
- 会议论文NeurIPS 2025
Unlearning-Aware Minimization:遗忘感知最小化
提出 min-max 机器遗忘框架 UAM,在图像分类及 WMDP-Bio/Cyber 基准上优于现有遗忘方法。
- 会议论文NeurIPS 2025
通过降低指令不确定性探索语义约束对抗样本
提出 InSUR 框架,从自然语言指令生成可迁移、自适应的语义约束对抗样本,并首次实现无参考的语义约束 3D 对抗样本生成。
- 会议论文NeurIPS 2025
拟合分布:针对多模态大模型的跨图像/提示对抗攻击
基于分布近似理论,优化单个输入无关的对抗扰动,使其在不同图文对间迁移,诱导 MLLM 产生有害回复。
- 会议论文NeurIPS 2025
通过特征最优对齐对闭源 MLLM 的对抗攻击
提出 FOA-Attack,结合全局余弦损失与基于最优传输的局部特征对齐及动态集成加权,提升对闭源 MLLM 的定向迁移攻击成功率。
- 会议论文NeurIPS 2025
加固时间序列:DTW 认证鲁棒的异常检测
基于随机平滑提出首个 DTW 距离下的认证鲁棒防御,在 DTW 对抗攻击下 F1 比传统认证模型最高提升 18.7%。
- 会议论文NeurIPS 2025
守护生命语言:从 DNA 语言模型到蛋白质的可遗传水印
针对 DNA 语言模型的生物安全双重用途风险,提出 DNAMark 与 CentralMark 水印,后者可从 DNA 传递到翻译出的蛋白质,检测 F1 超过 0.85。
- 会议论文NeurIPS 2025
纠正基于偏好的奖励学习中的捷径行为
将奖励作弊视为捷径行为,提出 PRISM 学习群不变核,降低奖励模型对冗长、谄媚等伪特征的依赖并提升 OOD 准确率。
- 会议论文NeurIPS 2025
追根溯源:利用扩散轨迹的时间动态做来源归属
分析整条扩散轨迹来判断图像是否来自训练集,挑战 Goldilocks zone 假设,并指出现有成员推断方法在分布偏移或含生成数据时会失效。