全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
通过修正策略优化增强 RLHF 中的安全性
指出期望安全约束会导致“安全补偿”,提出 RePO 对每个提示施加关键安全约束,显著提升 LLM 安全对齐。
- 会议论文NeurIPS 2025
协同样本选择与触发器的通用组件:高效的仅投毒干净标签后门攻击
提出一组可集成到多种干净标签后门攻击中的组件,通过协同选择样本与优化触发器,同时提升攻击成功率与隐蔽性。
- 会议论文NeurIPS 2025
BadVLA:通过目标解耦优化对视觉-语言-动作模型实施后门攻击
提出两阶段后门攻击,在多个 VLA 基准上攻击成功率近 100%,对干净任务影响很小,并对微调等扰动保持鲁棒。
- 会议论文NeurIPS 2025
Robust SuperAlignment:视觉语言模型的弱到强鲁棒性泛化
提出弱到强对抗鲁棒性泛化方法,用无监督方式把对抗鲁棒性从弱模型迁移到强 VLM,缓解其面对对抗攻击的脆弱性。
- 会议论文NeurIPS 2025
理解并提升神经概率电路的对抗鲁棒性
证明 NPC 的对抗鲁棒性只取决于属性识别模块,并提出 RNPC,用类别级整合获得可证明更强的鲁棒性且保持良性精度。
- 会议论文NeurIPS 2025
统一差分隐私下的重识别、属性推断与数据重建风险
基于 f-DP 给出三类攻击成功率的统一可调上界,比既有方法更紧,校准噪声可减少约 20%。
- 会议论文NeurIPS 2025
PolyJuice:针对合成图像检测器的黑盒通用红队方法
利用文生图潜空间中检测器正误分类样本的分布偏移方向,黑盒、与图像无关地引导生成图像欺骗检测器,欺骗率最高达 84%,用其增强数据微调检测器可提升最多 30%。
- 会议论文NeurIPS 2025
Panacea:通过微调后扰动缓解 LLM 有害微调
发现随机扰动即可恢复安全性,进而优化自适应扰动,在不损失下游性能的前提下将平均有害分数最多降低 21.2%。
- 会议论文NeurIPS 2025
打破检测器中的潜在先验偏差:实现可泛化的 AIGC 图像检测
发现 AIGC 检测器会学到与初始噪声相关的捷径,提出 On-Manifold 对抗训练并构建 GenImage++ 基准,显著提升对未见生成器的跨生成器检测性能。
- 会议论文NeurIPS 2025
BackdoorLLM:大语言模型后门攻击与防御综合基准
首个文本生成 LLM 后门基准,涵盖数据投毒、权重投毒、隐状态操纵和思维链劫持等攻击,含 200 余项实验与 7 种防御。
- 会议论文NeurIPS 2025
用空间对抗对齐提升对抗样本迁移性
提出 SAA,用 witness 模型对齐微调代理模型的全局与局部特征,并引入自对抗约束,使对抗样本在 CNN 到 ViT 等跨架构场景下迁移性更高。
- 会议论文NeurIPS 2025
基于贝叶斯数据调度器的 LLM 有害微调自适应防御
提出 BDS,把有害微调防御建模为贝叶斯推断,学习每个数据点的安全属性后加权微调,无需攻击模拟即可自适应防御,效果达到 SOTA。
- 会议论文NeurIPS 2025
通过跨模态对齐增强 CLIP 的对抗鲁棒性
提出免训练的 COLA,用最优传输恢复对抗扰动下的图文对齐,在 14 个零样本基准上,PGD 攻击下 ImageNet 平均提升 6.7%。
- 会议论文NeurIPS 2025
SeCon-RAG:面向可信 RAG 的两阶段语义过滤与无冲突框架
针对 RAG 语料投毒与污染攻击,提出两阶段语义过滤与冲突过滤防御,在保留有用知识的同时提升鲁棒性,优于现有防御。
- 会议论文NeurIPS 2025
具有合理可否认性的深度学习
提出 PD-SGD,用拒绝采样阻止无法合理否认的小批量更新参数,在理论上缓解个体数据泄露,隐私-效用权衡优于现有防御。
- 会议论文NeurIPS 2025
通过神经激活重定向实现 LLM 遗忘
提出 LUNAR,将待遗忘数据的表示重定向到表达无法回答的激活区域,遗忘效果与模型效用综合得分提升2.9至11.7倍,并能抵抗白盒对抗攻击。
- 会议论文NeurIPS 2025
差分隐私的序贯审计
提出面向黑盒机制的序贯检验来审计差分隐私保证,样本量从约5万降到数百,并能在不到一次训练内发现 DP-SGD 的隐私违规。
- 会议论文NeurIPS 2025
大语言模型的安全深度:马尔可夫链视角
提出安全深度概念,用马尔可夫链推导最优安全深度,并以循环群增强提升六个 LLM 的安全分数,发现更大集成宽度可弥补较浅对齐。
- 会议论文NeurIPS 2025
可扩展监督的缩放律
提出以监督者与被监督系统能力差建模监督成功率的框架,在 Mafia、Debate、Backdoor Code、Wargames 上拟合缩放律,并分析嵌套式可扩展监督(NSO)的成功率随能力差增大而下降。
- 会议论文NeurIPS 2025
进攻性网络安全智能体的动态风险评估
主张评估应考虑攻击者的自由度;仅用 8 个 H100 GPU 小时,攻击者即可将智能体在 InterCode CTF 上的能力相对提升超 40%。
- 会议论文NeurIPS 2025
TransferBench:基于集成的黑盒迁移攻击基准
提出 TransferBench,在 17 种更现实的设置下评测集成式黑盒迁移攻击,发现现有方法难以泛化,查询式优化几乎没有收益。
- 会议论文NeurIPS 2025
噪声注入揭示 sandbagging 语言模型的隐藏能力
向模型权重注入噪声检测 sandbagging:普通模型性能随噪声下降,而故意藏拙的模型会异常提升,并能激发 Mistral Large 120B 的完整表现。
- 会议论文NeurIPS 2025
过拟合攻击:仅用 10 条良性样本微调即可越狱 LLM
先用相同拒答的良性样本使模型过拟合,再用普通良性回答微调使其遗忘拒答,在十个 LLM 上攻击效果与隐蔽性均优于五个基线。
- 会议论文NeurIPS 2025
迈向不可逆攻击:基于多种群协同进化搜索欺骗场景文本识别
提出 MPCS 方法对场景文本识别模型逐字符攻击,解决扰动像素集中问题,使攻击结果难以被词典或语言模型纠正。