全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
LORE:面向视觉编码器的拉格朗日优化鲁棒嵌入
提出基于约束优化的无监督对抗微调框架 LORE,稳定训练并显著提升零样本对抗鲁棒性,干净数据精度损失很小。
- 会议论文NeurIPS 2025
超越 Oracle:面向指令层级的验证器监督
用带可执行验证器的指令冲突样本微调模型,提升指令层级遵循,并泛化提升对抗性安全基准上的鲁棒性。
- 会议论文NeurIPS 2025
基于自回归奖励引导表征编辑的 LLM 去毒
提出 ARGRE,在表征空间建模毒性过渡并训练奖励模型指导推理时编辑,在 8 个 LLM 上毒性降低 62.21%、推理时间减少 47.58%。
- 会议论文NeurIPS 2025
WASP:Web Agent 抗提示注入安全基准
提出端到端评测基准 WASP,发现顶级模型也会被简单人工注入欺骗,攻击部分成功率高达 86%,但完整达成攻击目标的情况较少。
- 会议论文NeurIPS 2025
强化学习中扩散模型引导的对抗状态扰动
提出基于扩散模型的 SHIFT 攻击,生成语义不同但逼真的扰动状态,能突破现有 RL 防御并优于已有攻击。
- 会议论文NeurIPS 2025
跨层对抗攻击:攻破文生图模型的多层防御
提出黑盒 TAA 框架,同时绕过提示过滤、概念擦除和图像过滤,在 14 个 T2I 模型上平均攻击成功率 85.6%。
- 会议论文NeurIPS 2025
成员究竟是什么?通过投毒使成员推断失信
证明可通过污染训练集让成员推断测试对目标样本给出错误预测,并给出准确率与抗投毒性的理论权衡,现有测试性能可降至随机以下。
- 会议论文NeurIPS 2025
简单取胜:重新思考用于 LLM 遗忘的 Negative Preference Optimization
指出 NPO 存在参考模型偏差,提出去除参考模型的 SimNPO 遗忘框架,在 TOFU、MUSE、WMDP 上验证有效。
- 会议论文NeurIPS 2025
BridgePure:有限的保护泄露即可攻破黑盒数据保护
提出保护泄露威胁模型,用少量未保护数据训练扩散桥模型,可去除黑盒不可学习样本的保护,暴露其漏洞。
- 会议论文NeurIPS 2025
带差分隐私的多类支持向量机
提出 PMSVM,通过权重和梯度扰动让多类 SVM 只访问每个样本一次,在多类场景下优于现有 DP-SVM 方法。
- 会议论文NeurIPS 2025
理解并纠正 VLM 中的安全感知失真
发现视觉模态引入使激活偏向“更安全”方向、导致 VLM 高估有害输入安全性,提出免训练的 ShiftDC 校准,恢复对齐且不损害能力。
- 会议论文NeurIPS 2025
通过排斥式视觉提示调优防御多模态后门模型
提出 RVPT,仅调 0.27% 参数并用特征排斥损失,将 CLIP 后门攻击成功率从 89.70% 降到 2.76%。
- 会议论文NeurIPS 2025
GuardReasoner-VL:通过强化推理守护 VLM
构建推理型 VLM 护栏模型,经 SFT 冷启动与在线 RL 训练,在多模态内容审核上平均 F1 比次优方法高 19.27%,并开源数据与模型。
- 会议论文NeurIPS 2025
智者知所不言:基于注意力转移的无幻觉 LLM 遗忘
提出 Attention-Shifting 遗忘框架,抑制事实 token 注意力并抑制编造回答,在 ToFU 与 TDEC 上准确率最高提升 15%、10%。
- 会议论文NeurIPS 2025
HQA-VLAttack:针对视觉语言预训练模型的高质量对抗攻击
提出黑盒框架,文本端用反拟合词向量替换,图像端用对比学习优化扰动,在三个基准上攻击成功率显著优于基线。
- 会议论文NeurIPS 2025
消失于无形:针对 SAM2 的跨提示通用对抗攻击
提出首个针对 SAM2 的跨提示通用对抗攻击 UAP-SAM2,通过双重语义偏移扰动,在六个数据集上大幅超越现有攻击。
- 会议论文NeurIPS 2025
DEGauss:防御针对高斯泼溅的恶意 3D 编辑
针对 3D 高斯泼溅被恶意编辑的滥用风险,提出多视角扰动防御,通过视角聚焦梯度融合与双重偏差优化破坏编辑轨迹,并能泛化到多种 3D 编辑流程。
- 会议论文NeurIPS 2025
VMDT:解码视频基础模型的可信性
提出首个视频模态可信性评测平台,覆盖安全、幻觉、公平、隐私与对抗鲁棒性;评测发现开源 T2V 模型普遍无法识别有害请求,且安全性与模型规模无关。
- 会议论文NeurIPS 2025
MIBP-Cert:基于混合整数双线性规划的抗数据扰动认证训练
针对训练数据错误、损坏与投毒攻击,用混合整数双线性规划计算可达参数集合,给出确定性的可证明鲁棒性,并适用于多种威胁模型。
- 会议论文NeurIPS 2025
UMU-Bench:弥合多模态遗忘评测中的模态差距
针对多模态大模型的隐私遗忘提出基准,发现现有遗忘方法普遍存在单模态与多模态知识移除不一致的问题。
- 会议论文NeurIPS 2025
残差流分析:过拟合与结构破坏
发现重复的安全数据导致残差流方差集中和误拒增多,提出 VCL 正则,使误拒率降低 35 个百分点以上且通用性能不降。
- 会议论文NeurIPS 2025
SafePTR:多模态大模型中基于先剪枝后恢复的 token 级越狱防御
发现早中层不到 1% 的有害 token 触发越狱,据此提出免训练的剪枝再恢复防御,在三个 MLLM、五个基准上提升安全且不损效用。
- 会议论文NeurIPS 2025
具有实体级隐私保证的差分隐私关系学习
针对关系数据提出带实体级 DP 保证的 DP-SGD 变体,含敏感度分析、按实体出现频率自适应裁剪,并扩展隐私放大分析,在文本编码器微调上取得较好隐私-效用权衡。
- 会议论文NeurIPS 2025
基于规则偏好建模的文生图系统红队测试
提出 RPG-RT,用 LLM 迭代改写提示并根据系统反馈微调,借助规则偏好建模适应未知防御,在 19 个 T2I 系统和 3 个商业 API 上验证有效。