全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
用追问预测黑盒语言模型的表现
以追问回答的概率训练线性预测器,可预测黑盒模型正确性,并检测被系统提示对抗操纵或被冒充的模型。
- 会议论文NeurIPS 2025
LORE:面向视觉编码器的拉格朗日优化鲁棒嵌入
提出基于约束优化的无监督对抗微调框架 LORE,稳定训练并显著提升零样本对抗鲁棒性,干净数据精度损失很小。
- 会议论文NeurIPS 2025
超越 Oracle:面向指令层级的验证器监督
用带可执行验证器的指令冲突样本微调模型,提升指令层级遵循,并泛化提升对抗性安全基准上的鲁棒性。
- 会议论文NeurIPS 2025
基于自回归奖励引导表征编辑的 LLM 去毒
提出 ARGRE,在表征空间建模毒性过渡并训练奖励模型指导推理时编辑,在 8 个 LLM 上毒性降低 62.21%、推理时间减少 47.58%。
- 会议论文NeurIPS 2025
简单取胜:重新思考用于 LLM 遗忘的 Negative Preference Optimization
指出 NPO 存在参考模型偏差,提出去除参考模型的 SimNPO 遗忘框架,在 TOFU、MUSE、WMDP 上验证有效。
- 会议论文NeurIPS 2025
理解并纠正 VLM 中的安全感知失真
发现视觉模态引入使激活偏向“更安全”方向、导致 VLM 高估有害输入安全性,提出免训练的 ShiftDC 校准,恢复对齐且不损害能力。
- 会议论文NeurIPS 2025
GuardReasoner-VL:通过强化推理守护 VLM
构建推理型 VLM 护栏模型,经 SFT 冷启动与在线 RL 训练,在多模态内容审核上平均 F1 比次优方法高 19.27%,并开源数据与模型。
- 会议论文NeurIPS 2025
DEGauss:防御针对高斯泼溅的恶意 3D 编辑
针对 3D 高斯泼溅被恶意编辑的滥用风险,提出多视角扰动防御,通过视角聚焦梯度融合与双重偏差优化破坏编辑轨迹,并能泛化到多种 3D 编辑流程。
- 会议论文NeurIPS 2025
残差流分析:过拟合与结构破坏
发现重复的安全数据导致残差流方差集中和误拒增多,提出 VCL 正则,使误拒率降低 35 个百分点以上且通用性能不降。
- 会议论文NeurIPS 2025
SafePTR:多模态大模型中基于先剪枝后恢复的 token 级越狱防御
发现早中层不到 1% 的有害 token 触发越狱,据此提出免训练的剪枝再恢复防御,在三个 MLLM、五个基准上提升安全且不损效用。
- 会议论文NeurIPS 2025
从语言模型中擦除概念知识
提出 ELM,用模型自身的内省分类能力做低秩更新,在生物安全、网络安全等领域擦除目标概念,同时保持通用能力,并对对抗攻击保持较强鲁棒性。
- 会议论文NeurIPS 2025
MixAT:结合连续与离散对抗训练的 LLM 防御
结合更强的离散攻击与更快的连续攻击做对抗训练,最坏情况攻击成功率(ALO-ASR)低于 20%,优于先前防御的 50% 以上,且开销相近。
- 会议论文NeurIPS 2025
Shape it Up!在微调中恢复 LLM 安全性
提出动态安全塑形 DSS,用护栏模型逐段评估回复的 STAR 信号,强化安全片段、抑制不安全内容,降低微调风险且不损失能力。
- 会议论文NeurIPS 2025
面向扩散模型安全使用的免训练安全去噪器
利用负例集合直接修改采样轨迹,让生成远离不安全、受版权或隐私数据区域,无需重训,在 CoPro 上达到领先安全表现。
- 会议论文NeurIPS 2025
用信息量更大的触发器提升神经网络指纹的唯一性
从信息论角度研究黑盒模型指纹,选取边际互信息最大的触发器,使版权溯源更准确高效,并可接入现有指纹方案。
- 会议论文NeurIPS 2025
增强 LLM 水印对擦除与伪造攻击的双重鲁棒性
提出 SEEK 水印方案,借助等价纹理密钥让窗口内多个 token 独立支持检测,在不牺牲抗伪造能力的同时提升对擦除攻击的鲁棒性。
- 会议论文NeurIPS 2025
SafeVid:面向安全对齐的视频大型多模态模型
以文本视频描述为桥梁迁移文本安全对齐,构建 35 万对偏好数据并用 DPO 对齐,在 SafeVidBench 上最高提升 42.39%。
- 会议论文NeurIPS 2025
IF-Guide:基于影响函数的 LLM 去毒化
用影响函数在 token 级定位训练数据中的有害内容并在预训练或微调中抑制,显式与隐式毒性最多降低 10 倍,且无需人类偏好数据。
- 会议论文NeurIPS 2025
对抗感知优化:基于扩散先验的鲁棒防御
提出基于优化的对抗扰动净化框架,结合预训练扩散先验与针对对抗扰动空间的似然项,在 CIFAR-10/100 上对多种常见攻击取得较强鲁棒准确率。
- 会议论文NeurIPS 2025
基于 Hölder 优化的可扩展神经网络几何鲁棒性验证
提出 H²V,用 Hilbert 空间填充与 Hölder 优化验证神经网络对几何扰动的局部鲁棒性,可扩展到 ResNet152、ViT 及视频 3D 网络。
- 会议论文NeurIPS 2025
反蒸馏采样(Antidistillation Sampling)
通过调整下一 token 概率分布来毒化推理轨迹,使其难以用于模型蒸馏,同时保持模型效用。
- 会议论文NeurIPS 2025
大语言模型中特定知识的弹性鲁棒遗忘
提出 ERU,用弹性奖励与拒答特征消融增强偏好优化式遗忘的效果与鲁棒性,在 WMDP-Bio 上提升 9%,重训练攻击下仍保持 83%。
- 会议论文NeurIPS 2025
展开网络(基于模型)的对抗泛化
推导展开网络在 l2 约束 FGSM 攻击下的对抗 Rademacher 复杂度与泛化界,并发现过参数化可提升对抗鲁棒性。
- 会议论文NeurIPS 2025
揭穿操纵者:利用生物特征泄露识别 AI 视频会议中的冒充
针对 AI 说话人视频会议中的 puppeteering 冒充攻击,用度量学习从潜在表示中解耦身份线索以检测未授权替换,可在消费级 GPU 上实时运行,优于已有防御。