全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
用强化学习逆向工程人类偏好
用 judge-LLM 的信号作为奖励,对抗式训练生成前置文本的模型,使冻结 LLM 获得更高评测分且几乎无法被察觉,并可迁移到未见的模型。
- 会议论文NeurIPS 2025
语言模型能预测自身行为
基于输入表示训练带 conformal 保证的探针,在生成前预警越狱等对齐失效,预警系统使越狱减少 91%。
- 会议论文NeurIPS 2025
AegisGuard:RL 引导的适配器调优,实现基于 TEE 的高效安全端侧推理
用 RL 排序对模型窃取敏感的 LoRA 适配器,仅将其放入 TEE 并压缩,窃取抵抗与全屏蔽相当,延迟降低 2–3 倍。
- 会议论文NeurIPS 2025
面向扩散模型的抗下游微调的安全遗忘
发现现有安全遗忘方法在良性数据微调后会失效,提出 ResAlign,通过隐式优化建模和元学习,使安全性在微调后仍得以保持。
- 会议论文NeurIPS 2025
用测谎器做偏好学习:可能诱导诚实,也可能诱导规避
把测谎器放进 LLM 后训练的标注环节:GRPO 可学出规避测谎器的策略(欺骗率超 85%),但测谎器 TPR 或 KL 正则足够高时可得诚实策略,DPO 欺骗率低于 25%。
- 会议论文NeurIPS 2025
Vid-SME:针对大型视频理解模型的成员推断攻击
提出首个面向视频理解 LLM 的成员推断方法,利用正常与时间反转帧的 Sharma–Mittal 熵差异判断视频是否在训练集中。
- 会议论文NeurIPS 2025
基于时序逻辑的多车后门攻击:针对端到端自动驾驶离线 RL 智能体
以其他车辆轨迹为触发器,用时序逻辑生成触发轨迹并加入负训练,在 5 个离线 RL 驾驶智能体上验证了攻击的灵活性与有效性。
- 会议论文NeurIPS 2025
EraseFlow:基于 GFlowNet 对齐学习概念擦除策略
把文生图的概念擦除视为去噪路径探索,用 GFlowNet 学习策略,在移除有害概念的同时保持生成质量。
- 会议论文NeurIPS 2025
AdvEDM:针对基于 VLM 的具身智能体的细粒度对抗攻击
只改变少数关键物体的感知并保留其余语义,使 VLM 输出有效但错误的决策,在通用和具身决策任务中攻击效果好。
- 会议论文NeurIPS 2025
RepGuard:大语言模型后门防御的自适应特征解耦
通过局部一致性与样本偏差定位可疑后门特征,并自适应掩码解耦,无需知道触发器;在目标拒答与越狱任务上平均将攻击成功率降低近 80%。
- 会议论文NeurIPS 2025
安全 + 安全 = 不安全?利用安全图像越狱大型视觉语言模型
提出 Safety Snowball Agent,借助 LVLM 的通用推理与安全滚雪球效应,用几乎任意图像逐步诱导有害输出,对最新 LVLM 越狱成功率高。
- 会议论文NeurIPS 2025
可解释的 RLHF:改进对齐
通过定位导致不满意回复的训练数据并对其进行遗忘,在不显著损害其他回复的前提下改进 RLHF 对齐后的语言模型。
- 会议论文NeurIPS 2025
Unlearning-Aware Minimization:遗忘感知最小化
提出 min-max 机器遗忘框架 UAM,在图像分类及 WMDP-Bio/Cyber 基准上优于现有遗忘方法。
- 会议论文NeurIPS 2025
通过降低指令不确定性探索语义约束对抗样本
提出 InSUR 框架,从自然语言指令生成可迁移、自适应的语义约束对抗样本,并首次实现无参考的语义约束 3D 对抗样本生成。
- 会议论文NeurIPS 2025
拟合分布:针对多模态大模型的跨图像/提示对抗攻击
基于分布近似理论,优化单个输入无关的对抗扰动,使其在不同图文对间迁移,诱导 MLLM 产生有害回复。
- 会议论文NeurIPS 2025
通过特征最优对齐对闭源 MLLM 的对抗攻击
提出 FOA-Attack,结合全局余弦损失与基于最优传输的局部特征对齐及动态集成加权,提升对闭源 MLLM 的定向迁移攻击成功率。
- 会议论文NeurIPS 2025
加固时间序列:DTW 认证鲁棒的异常检测
基于随机平滑提出首个 DTW 距离下的认证鲁棒防御,在 DTW 对抗攻击下 F1 比传统认证模型最高提升 18.7%。
- 会议论文NeurIPS 2025
守护生命语言:从 DNA 语言模型到蛋白质的可遗传水印
针对 DNA 语言模型的生物安全双重用途风险,提出 DNAMark 与 CentralMark 水印,后者可从 DNA 传递到翻译出的蛋白质,检测 F1 超过 0.85。
- 会议论文NeurIPS 2025
纠正基于偏好的奖励学习中的捷径行为
将奖励作弊视为捷径行为,提出 PRISM 学习群不变核,降低奖励模型对冗长、谄媚等伪特征的依赖并提升 OOD 准确率。
- 会议论文NeurIPS 2025
追根溯源:利用扩散轨迹的时间动态做来源归属
分析整条扩散轨迹来判断图像是否来自训练集,挑战 Goldilocks zone 假设,并指出现有成员推断方法在分布偏移或含生成数据时会失效。
- 会议论文NeurIPS 2025
GuardSet-X:大规模多领域、基于安全政策的护栏数据集
覆盖八个领域、基于真实安全准则构建,并含对抗增强样本,评测 19 个护栏模型,发现跨风险类别方差大,且都易受优化的对抗攻击。
- 会议论文NeurIPS 2025
RoMa:保护扩散模型知识产权的鲁棒模型水印方案
利用线性模式连通性分析水印对微调的脆弱性,提出提升路径平滑性的水印方案,显著增强抗微调鲁棒性并保持生成质量。
- 会议论文NeurIPS 2025
AgentBreeder:通过自我改进缓解多智能体脚手架的 AI 安全风险
用多目标进化搜索多智能体脚手架:蓝色模式下安全基准平均提升 79.4%,红色模式下发现对抗性薄弱的脚手架。
- 会议论文NeurIPS 2025
从判断到干预:通过流式内容监控提前终止 LLM 有害输出
构建 token 级标注数据集 FineHarm 并训练流式监控器 SCM,平均仅看前 18% token 即达到接近全文检测的 F1,还可作为伪标注器改进安全对齐。