全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
GuardReasoner-VL:通过强化推理守护 VLM
构建推理型 VLM 护栏模型,经 SFT 冷启动与在线 RL 训练,在多模态内容审核上平均 F1 比次优方法高 19.27%,并开源数据与模型。
- 会议论文NeurIPS 2025
DEGauss:防御针对高斯泼溅的恶意 3D 编辑
针对 3D 高斯泼溅被恶意编辑的滥用风险,提出多视角扰动防御,通过视角聚焦梯度融合与双重偏差优化破坏编辑轨迹,并能泛化到多种 3D 编辑流程。
- 会议论文NeurIPS 2025
残差流分析:过拟合与结构破坏
发现重复的安全数据导致残差流方差集中和误拒增多,提出 VCL 正则,使误拒率降低 35 个百分点以上且通用性能不降。
- 会议论文NeurIPS 2025
SafePTR:多模态大模型中基于先剪枝后恢复的 token 级越狱防御
发现早中层不到 1% 的有害 token 触发越狱,据此提出免训练的剪枝再恢复防御,在三个 MLLM、五个基准上提升安全且不损效用。
- 会议论文NeurIPS 2025
从语言模型中擦除概念知识
提出 ELM,用模型自身的内省分类能力做低秩更新,在生物安全、网络安全等领域擦除目标概念,同时保持通用能力,并对对抗攻击保持较强鲁棒性。
- 会议论文NeurIPS 2025
MixAT:结合连续与离散对抗训练的 LLM 防御
结合更强的离散攻击与更快的连续攻击做对抗训练,最坏情况攻击成功率(ALO-ASR)低于 20%,优于先前防御的 50% 以上,且开销相近。
- 会议论文NeurIPS 2025
Shape it Up!在微调中恢复 LLM 安全性
提出动态安全塑形 DSS,用护栏模型逐段评估回复的 STAR 信号,强化安全片段、抑制不安全内容,降低微调风险且不损失能力。
- 会议论文NeurIPS 2025
面向扩散模型安全使用的免训练安全去噪器
利用负例集合直接修改采样轨迹,让生成远离不安全、受版权或隐私数据区域,无需重训,在 CoPro 上达到领先安全表现。
- 会议论文NeurIPS 2025
用信息量更大的触发器提升神经网络指纹的唯一性
从信息论角度研究黑盒模型指纹,选取边际互信息最大的触发器,使版权溯源更准确高效,并可接入现有指纹方案。
- 会议论文NeurIPS 2025
增强 LLM 水印对擦除与伪造攻击的双重鲁棒性
提出 SEEK 水印方案,借助等价纹理密钥让窗口内多个 token 独立支持检测,在不牺牲抗伪造能力的同时提升对擦除攻击的鲁棒性。
- 会议论文NeurIPS 2025
SafeVid:面向安全对齐的视频大型多模态模型
以文本视频描述为桥梁迁移文本安全对齐,构建 35 万对偏好数据并用 DPO 对齐,在 SafeVidBench 上最高提升 42.39%。
- 会议论文NeurIPS 2025
IF-Guide:基于影响函数的 LLM 去毒化
用影响函数在 token 级定位训练数据中的有害内容并在预训练或微调中抑制,显式与隐式毒性最多降低 10 倍,且无需人类偏好数据。
- 会议论文NeurIPS 2025
对抗感知优化:基于扩散先验的鲁棒防御
提出基于优化的对抗扰动净化框架,结合预训练扩散先验与针对对抗扰动空间的似然项,在 CIFAR-10/100 上对多种常见攻击取得较强鲁棒准确率。
- 会议论文NeurIPS 2025
基于 Hölder 优化的可扩展神经网络几何鲁棒性验证
提出 H²V,用 Hilbert 空间填充与 Hölder 优化验证神经网络对几何扰动的局部鲁棒性,可扩展到 ResNet152、ViT 及视频 3D 网络。
- 会议论文NeurIPS 2025
反蒸馏采样(Antidistillation Sampling)
通过调整下一 token 概率分布来毒化推理轨迹,使其难以用于模型蒸馏,同时保持模型效用。
- 会议论文NeurIPS 2025
大语言模型中特定知识的弹性鲁棒遗忘
提出 ERU,用弹性奖励与拒答特征消融增强偏好优化式遗忘的效果与鲁棒性,在 WMDP-Bio 上提升 9%,重训练攻击下仍保持 83%。
- 会议论文NeurIPS 2025
展开网络(基于模型)的对抗泛化
推导展开网络在 l2 约束 FGSM 攻击下的对抗 Rademacher 复杂度与泛化界,并发现过参数化可提升对抗鲁棒性。
- 会议论文NeurIPS 2025
揭穿操纵者:利用生物特征泄露识别 AI 视频会议中的冒充
针对 AI 说话人视频会议中的 puppeteering 冒充攻击,用度量学习从潜在表示中解耦身份线索以检测未授权替换,可在消费级 GPU 上实时运行,优于已有防御。
- 会议论文NeurIPS 2025
面向自回归音频生成模型的鲁棒无失真水印
针对音频重新分词不匹配问题提出 Aligned-IS 无失真水印,通过 token 聚类在保持音质的同时显著提升水印检测率。
- 会议论文NeurIPS 2025
理解并改进针对 l0 有界扰动的快速对抗训练
分析 l0 对抗训练中 catastrophic overfitting 源于单步攻击扰动位置次优,并用 soft labels 与 trade-off loss 平滑损失面,缩小单步与多步训练差距。
- 会议论文NeurIPS 2025
DiffBreak:基于扩散的对抗净化真的鲁棒吗?
理论与实验表明扩散净化的鲁棒性因梯度不准和评估协议缺陷被高估,提出 DiffBreak 工具包,并设计针对多数投票防御的攻击,使其失效。
- 会议论文NeurIPS 2025
文生图扩散模型 NSFW 内容擦除的综合评估与分析
提出概念擦除全流程工具包,对 NSFW 概念擦除方法做首次系统研究,并给出实际应用指导。
- 会议论文NeurIPS 2025
Conformal Arbitrage:语言模型中竞争目标的风险受控平衡
用 conformal risk control 校准阈值,在主模型与保守 Guardian 之间切换,使事实错误或安全违规频率有分布无关的有限样本保证。
- 会议论文NeurIPS 2025
EVOREFUSE:评估并缓解 LLM 对伪恶意指令过度拒答的进化式提示优化
用进化算法生成诱发过度拒答的伪恶意指令,构建评测集与对齐数据;微调后 Llama3.1-8B 过度拒答最多减少 29.85% 且不损安全。