全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
文生图扩散模型的免训练安全文本嵌入引导
提出 STG,在采样时依据去噪图像的安全函数调整文本嵌入,无需训练即可去除裸露、暴力等不安全内容并保持语义。
- 会议论文NeurIPS 2025
自回归图像生成的水印
首次在 token 层面为自回归图像模型加水印,通过微调 tokenizer 改善反向循环一致性并加同步层,对图像变换与移除攻击保持鲁棒。
- 会议论文NeurIPS 2025
RULE:强化遗忘实现遗忘与保留的帕累托最优
把 LLM 遗忘建模为拒答边界优化,用可验证奖励训练,仅用少量遗忘数据即在遗忘质量和自然度上超过基线。
- 会议论文NeurIPS 2025
RSafe:以主动推理构建鲁棒自适应的 LLM 护栏
先做策略引导的安全推理,再用规则式 RL 对齐推理路径,在未见有害类别与越狱攻击上泛化更好,并给出可读解释。
- 会议论文NeurIPS 2025
AegisGuard:RL 引导的适配器调优,实现基于 TEE 的高效安全端侧推理
用 RL 排序对模型窃取敏感的 LoRA 适配器,仅将其放入 TEE 并压缩,窃取抵抗与全屏蔽相当,延迟降低 2–3 倍。
- 会议论文NeurIPS 2025
面向扩散模型的抗下游微调的安全遗忘
发现现有安全遗忘方法在良性数据微调后会失效,提出 ResAlign,通过隐式优化建模和元学习,使安全性在微调后仍得以保持。
- 会议论文NeurIPS 2025
EraseFlow:基于 GFlowNet 对齐学习概念擦除策略
把文生图的概念擦除视为去噪路径探索,用 GFlowNet 学习策略,在移除有害概念的同时保持生成质量。
- 会议论文NeurIPS 2025
加固时间序列:DTW 认证鲁棒的异常检测
基于随机平滑提出首个 DTW 距离下的认证鲁棒防御,在 DTW 对抗攻击下 F1 比传统认证模型最高提升 18.7%。
- 会议论文NeurIPS 2025
GuardSet-X:大规模多领域、基于安全政策的护栏数据集
覆盖八个领域、基于真实安全准则构建,并含对抗增强样本,评测 19 个护栏模型,发现跨风险类别方差大,且都易受优化的对抗攻击。
- 会议论文NeurIPS 2025
RoMa:保护扩散模型知识产权的鲁棒模型水印方案
利用线性模式连通性分析水印对微调的脆弱性,提出提升路径平滑性的水印方案,显著增强抗微调鲁棒性并保持生成质量。
- 会议论文NeurIPS 2025
从判断到干预:通过流式内容监控提前终止 LLM 有害输出
构建 token 级标注数据集 FineHarm 并训练流式监控器 SCM,平均仅看前 18% token 即达到接近全文检测的 F1,还可作为伪标注器改进安全对齐。
- 会议论文NeurIPS 2025
用奇异池化增强图分类鲁棒性
理论分析 sum、average、max 池化的对抗风险,提出基于主奇异向量的 RS-Pool,在对抗攻击下更鲁棒且保持干净精度。
- 会议论文NeurIPS 2025
C-SafeGen:基于声明级流式护栏的可认证安全 LLM 生成
提出 Claim-based Stream Decoding,用流式护栏检查并回溯修订高风险声明,并以共形分析给出可认证的安全风险上界,含在线设置。
- 会议论文NeurIPS 2025
FocalLoRA:面向 LLM 指令层级对齐的焦点注意力头微调
针对指令冲突时 LLM 难以遵循系统级指令的问题,只微调对冲突敏感的 focal heads,在 Llama-8B 上用 0.0188% 参数将系统指令遵循率提升 35.52%。
- 会议论文NeurIPS 2025
ALMGuard:为音频语言模型寻找安全捷径作为护栏
提出首个面向 ALM 的防御框架,用通用 Shortcut Activation Perturbations 激活安全捷径,将越狱攻击平均成功率降至 4.6% 且保持良性任务效用。
- 会议论文NeurIPS 2025
发现并重新激活后训练 LLM 中被隐藏的安全机制
发现后训练会掩盖基座模型的安全机制但并未删除,提出 SafeReAct 用少数层的 LoRA 恢复安全行为,且不损害推理性能。
- 会议论文NeurIPS 2025
通过解耦层间依赖加速纵向联邦对抗学习
提出 DecVFAL 框架,通过双层解耦加速纵向联邦学习中的对抗训练,在保持鲁棒性的同时实现约 3 到 10 倍加速,并给出收敛分析。
- 会议论文NeurIPS 2025
一头定乾坤:用单个关键注意力头增强 LVLM 安全性
发现 LVLM 的安全能力集中在特定注意力头,提出免训练的 Oh Defense,对不安全输入防御成功率超 98%,误报率低于 5%。
- 会议论文NeurIPS 2025
Robust SuperAlignment:视觉语言模型的弱到强鲁棒性泛化
提出弱到强对抗鲁棒性泛化方法,用无监督方式把对抗鲁棒性从弱模型迁移到强 VLM,缓解其面对对抗攻击的脆弱性。
- 会议论文NeurIPS 2025
理解并提升神经概率电路的对抗鲁棒性
证明 NPC 的对抗鲁棒性只取决于属性识别模块,并提出 RNPC,用类别级整合获得可证明更强的鲁棒性且保持良性精度。
- 会议论文NeurIPS 2025
Panacea:通过微调后扰动缓解 LLM 有害微调
发现随机扰动即可恢复安全性,进而优化自适应扰动,在不损失下游性能的前提下将平均有害分数最多降低 21.2%。
- 会议论文NeurIPS 2025
打破检测器中的潜在先验偏差:实现可泛化的 AIGC 图像检测
发现 AIGC 检测器会学到与初始噪声相关的捷径,提出 On-Manifold 对抗训练并构建 GenImage++ 基准,显著提升对未见生成器的跨生成器检测性能。
- 会议论文NeurIPS 2025
基于贝叶斯数据调度器的 LLM 有害微调自适应防御
提出 BDS,把有害微调防御建模为贝叶斯推断,学习每个数据点的安全属性后加权微调,无需攻击模拟即可自适应防御,效果达到 SOTA。
- 会议论文NeurIPS 2025
通过跨模态对齐增强 CLIP 的对抗鲁棒性
提出免训练的 COLA,用最优传输恢复对抗扰动下的图文对齐,在 14 个零样本基准上,PGD 攻击下 ImageNet 平均提升 6.7%。