全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
统一差分隐私下的重识别、属性推断与数据重建风险
基于 f-DP 给出三类攻击成功率的统一可调上界,比既有方法更紧,校准噪声可减少约 20%。
- 会议论文NeurIPS 2025
PolyJuice:针对合成图像检测器的黑盒通用红队方法
利用文生图潜空间中检测器正误分类样本的分布偏移方向,黑盒、与图像无关地引导生成图像欺骗检测器,欺骗率最高达 84%,用其增强数据微调检测器可提升最多 30%。
- 会议论文NeurIPS 2025
Panacea:通过微调后扰动缓解 LLM 有害微调
发现随机扰动即可恢复安全性,进而优化自适应扰动,在不损失下游性能的前提下将平均有害分数最多降低 21.2%。
- 会议论文NeurIPS 2025
打破检测器中的潜在先验偏差:实现可泛化的 AIGC 图像检测
发现 AIGC 检测器会学到与初始噪声相关的捷径,提出 On-Manifold 对抗训练并构建 GenImage++ 基准,显著提升对未见生成器的跨生成器检测性能。
- 会议论文NeurIPS 2025
BackdoorLLM:大语言模型后门攻击与防御综合基准
首个文本生成 LLM 后门基准,涵盖数据投毒、权重投毒、隐状态操纵和思维链劫持等攻击,含 200 余项实验与 7 种防御。
- 会议论文NeurIPS 2025
用空间对抗对齐提升对抗样本迁移性
提出 SAA,用 witness 模型对齐微调代理模型的全局与局部特征,并引入自对抗约束,使对抗样本在 CNN 到 ViT 等跨架构场景下迁移性更高。
- 会议论文NeurIPS 2025
基于贝叶斯数据调度器的 LLM 有害微调自适应防御
提出 BDS,把有害微调防御建模为贝叶斯推断,学习每个数据点的安全属性后加权微调,无需攻击模拟即可自适应防御,效果达到 SOTA。
- 会议论文NeurIPS 2025
通过跨模态对齐增强 CLIP 的对抗鲁棒性
提出免训练的 COLA,用最优传输恢复对抗扰动下的图文对齐,在 14 个零样本基准上,PGD 攻击下 ImageNet 平均提升 6.7%。
- 会议论文NeurIPS 2025
SeCon-RAG:面向可信 RAG 的两阶段语义过滤与无冲突框架
针对 RAG 语料投毒与污染攻击,提出两阶段语义过滤与冲突过滤防御,在保留有用知识的同时提升鲁棒性,优于现有防御。
- 会议论文NeurIPS 2025
具有合理可否认性的深度学习
提出 PD-SGD,用拒绝采样阻止无法合理否认的小批量更新参数,在理论上缓解个体数据泄露,隐私-效用权衡优于现有防御。
- 会议论文NeurIPS 2025
通过神经激活重定向实现 LLM 遗忘
提出 LUNAR,将待遗忘数据的表示重定向到表达无法回答的激活区域,遗忘效果与模型效用综合得分提升2.9至11.7倍,并能抵抗白盒对抗攻击。
- 会议论文NeurIPS 2025
差分隐私的序贯审计
提出面向黑盒机制的序贯检验来审计差分隐私保证,样本量从约5万降到数百,并能在不到一次训练内发现 DP-SGD 的隐私违规。
- 会议论文NeurIPS 2025
大语言模型的安全深度:马尔可夫链视角
提出安全深度概念,用马尔可夫链推导最优安全深度,并以循环群增强提升六个 LLM 的安全分数,发现更大集成宽度可弥补较浅对齐。
- 会议论文NeurIPS 2025
可扩展监督的缩放律
提出以监督者与被监督系统能力差建模监督成功率的框架,在 Mafia、Debate、Backdoor Code、Wargames 上拟合缩放律,并分析嵌套式可扩展监督(NSO)的成功率随能力差增大而下降。
- 会议论文NeurIPS 2025
进攻性网络安全智能体的动态风险评估
主张评估应考虑攻击者的自由度;仅用 8 个 H100 GPU 小时,攻击者即可将智能体在 InterCode CTF 上的能力相对提升超 40%。
- 会议论文NeurIPS 2025
TransferBench:基于集成的黑盒迁移攻击基准
提出 TransferBench,在 17 种更现实的设置下评测集成式黑盒迁移攻击,发现现有方法难以泛化,查询式优化几乎没有收益。
- 会议论文NeurIPS 2025
噪声注入揭示 sandbagging 语言模型的隐藏能力
向模型权重注入噪声检测 sandbagging:普通模型性能随噪声下降,而故意藏拙的模型会异常提升,并能激发 Mistral Large 120B 的完整表现。
- 会议论文NeurIPS 2025
过拟合攻击:仅用 10 条良性样本微调即可越狱 LLM
先用相同拒答的良性样本使模型过拟合,再用普通良性回答微调使其遗忘拒答,在十个 LLM 上攻击效果与隐蔽性均优于五个基线。
- 会议论文NeurIPS 2025
迈向不可逆攻击:基于多种群协同进化搜索欺骗场景文本识别
提出 MPCS 方法对场景文本识别模型逐字符攻击,解决扰动像素集中问题,使攻击结果难以被词典或语言模型纠正。
- 会议论文NeurIPS 2025
通过缓解分类复杂度实现鲁棒图凝聚
发现图凝聚在原图受污染时性能显著下降,提出 MRGC,用流形约束使凝聚图保持低分类复杂度,在多种对抗攻击下保持鲁棒。
- 会议论文NeurIPS 2025
SAFEPATH:通过早期对齐防止思维链中的有害推理
微调推理模型在推理开头输出 8 token 安全引导语,在 R1-Distill-Llama-8B 上最多减少 90% 有害回答、拦截 83.3% 越狱,计算量远低于基线。
- 会议论文NeurIPS 2025
基于可逆剪枝掩码的后门缓解
提出带可逆剪枝掩码的双层优化方法,识别并剪除后门相关参数,在少量数据下优于现有剪枝式后门防御,并可比肩微调类方法。
- 会议论文NeurIPS 2025
基于谱方法的子图联邦学习
提出 FedLap,通过谱域拉普拉斯平滑捕获跨客户端节点依赖,避免交换敏感节点嵌入,并给出隐私分析;效用与现有方法相当或更优。
- 会议论文NeurIPS 2025
仅用负样本从文生图模型中移除概念
Clipout 随机裁剪嵌入单元并用对比目标,仅凭自举生成的负样本,无需重训即可移除隐私、版权或有害概念,效果优于现有方法。