全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
DiffBreak:基于扩散的对抗净化真的鲁棒吗?
理论与实验表明扩散净化的鲁棒性因梯度不准和评估协议缺陷被高估,提出 DiffBreak 工具包,并设计针对多数投票防御的攻击,使其失效。
- 会议论文NeurIPS 2025
文生图扩散模型 NSFW 内容擦除的综合评估与分析
提出概念擦除全流程工具包,对 NSFW 概念擦除方法做首次系统研究,并给出实际应用指导。
- 会议论文NeurIPS 2025
Conformal Arbitrage:语言模型中竞争目标的风险受控平衡
用 conformal risk control 校准阈值,在主模型与保守 Guardian 之间切换,使事实错误或安全违规频率有分布无关的有限样本保证。
- 会议论文NeurIPS 2025
EVOREFUSE:评估并缓解 LLM 对伪恶意指令过度拒答的进化式提示优化
用进化算法生成诱发过度拒答的伪恶意指令,构建评测集与对齐数据;微调后 Llama3.1-8B 过度拒答最多减少 29.85% 且不损安全。
- 会议论文NeurIPS 2025
文生图扩散模型的免训练安全文本嵌入引导
提出 STG,在采样时依据去噪图像的安全函数调整文本嵌入,无需训练即可去除裸露、暴力等不安全内容并保持语义。
- 会议论文NeurIPS 2025
自回归图像生成的水印
首次在 token 层面为自回归图像模型加水印,通过微调 tokenizer 改善反向循环一致性并加同步层,对图像变换与移除攻击保持鲁棒。
- 会议论文NeurIPS 2025
RULE:强化遗忘实现遗忘与保留的帕累托最优
把 LLM 遗忘建模为拒答边界优化,用可验证奖励训练,仅用少量遗忘数据即在遗忘质量和自然度上超过基线。
- 会议论文NeurIPS 2025
RSafe:以主动推理构建鲁棒自适应的 LLM 护栏
先做策略引导的安全推理,再用规则式 RL 对齐推理路径,在未见有害类别与越狱攻击上泛化更好,并给出可读解释。
- 会议论文NeurIPS 2025
AegisGuard:RL 引导的适配器调优,实现基于 TEE 的高效安全端侧推理
用 RL 排序对模型窃取敏感的 LoRA 适配器,仅将其放入 TEE 并压缩,窃取抵抗与全屏蔽相当,延迟降低 2–3 倍。
- 会议论文NeurIPS 2025
面向扩散模型的抗下游微调的安全遗忘
发现现有安全遗忘方法在良性数据微调后会失效,提出 ResAlign,通过隐式优化建模和元学习,使安全性在微调后仍得以保持。
- 会议论文NeurIPS 2025
EraseFlow:基于 GFlowNet 对齐学习概念擦除策略
把文生图的概念擦除视为去噪路径探索,用 GFlowNet 学习策略,在移除有害概念的同时保持生成质量。
- 会议论文NeurIPS 2025
加固时间序列:DTW 认证鲁棒的异常检测
基于随机平滑提出首个 DTW 距离下的认证鲁棒防御,在 DTW 对抗攻击下 F1 比传统认证模型最高提升 18.7%。
- 会议论文NeurIPS 2025
GuardSet-X:大规模多领域、基于安全政策的护栏数据集
覆盖八个领域、基于真实安全准则构建,并含对抗增强样本,评测 19 个护栏模型,发现跨风险类别方差大,且都易受优化的对抗攻击。
- 会议论文NeurIPS 2025
RoMa:保护扩散模型知识产权的鲁棒模型水印方案
利用线性模式连通性分析水印对微调的脆弱性,提出提升路径平滑性的水印方案,显著增强抗微调鲁棒性并保持生成质量。
- 会议论文NeurIPS 2025
从判断到干预:通过流式内容监控提前终止 LLM 有害输出
构建 token 级标注数据集 FineHarm 并训练流式监控器 SCM,平均仅看前 18% token 即达到接近全文检测的 F1,还可作为伪标注器改进安全对齐。
- 会议论文NeurIPS 2025
用奇异池化增强图分类鲁棒性
理论分析 sum、average、max 池化的对抗风险,提出基于主奇异向量的 RS-Pool,在对抗攻击下更鲁棒且保持干净精度。
- 会议论文NeurIPS 2025
C-SafeGen:基于声明级流式护栏的可认证安全 LLM 生成
提出 Claim-based Stream Decoding,用流式护栏检查并回溯修订高风险声明,并以共形分析给出可认证的安全风险上界,含在线设置。
- 会议论文NeurIPS 2025
FocalLoRA:面向 LLM 指令层级对齐的焦点注意力头微调
针对指令冲突时 LLM 难以遵循系统级指令的问题,只微调对冲突敏感的 focal heads,在 Llama-8B 上用 0.0188% 参数将系统指令遵循率提升 35.52%。
- 会议论文NeurIPS 2025
ALMGuard:为音频语言模型寻找安全捷径作为护栏
提出首个面向 ALM 的防御框架,用通用 Shortcut Activation Perturbations 激活安全捷径,将越狱攻击平均成功率降至 4.6% 且保持良性任务效用。
- 会议论文NeurIPS 2025
发现并重新激活后训练 LLM 中被隐藏的安全机制
发现后训练会掩盖基座模型的安全机制但并未删除,提出 SafeReAct 用少数层的 LoRA 恢复安全行为,且不损害推理性能。
- 会议论文NeurIPS 2025
通过解耦层间依赖加速纵向联邦对抗学习
提出 DecVFAL 框架,通过双层解耦加速纵向联邦学习中的对抗训练,在保持鲁棒性的同时实现约 3 到 10 倍加速,并给出收敛分析。
- 会议论文NeurIPS 2025
一头定乾坤:用单个关键注意力头增强 LVLM 安全性
发现 LVLM 的安全能力集中在特定注意力头,提出免训练的 Oh Defense,对不安全输入防御成功率超 98%,误报率低于 5%。
- 会议论文NeurIPS 2025
Robust SuperAlignment:视觉语言模型的弱到强鲁棒性泛化
提出弱到强对抗鲁棒性泛化方法,用无监督方式把对抗鲁棒性从弱模型迁移到强 VLM,缓解其面对对抗攻击的脆弱性。
- 会议论文NeurIPS 2025
理解并提升神经概率电路的对抗鲁棒性
证明 NPC 的对抗鲁棒性只取决于属性识别模块,并提出 RNPC,用类别级整合获得可证明更强的鲁棒性且保持良性精度。