全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
Panacea:通过微调后扰动缓解 LLM 有害微调
发现随机扰动即可恢复安全性,进而优化自适应扰动,在不损失下游性能的前提下将平均有害分数最多降低 21.2%。
- 会议论文NeurIPS 2025
打破检测器中的潜在先验偏差:实现可泛化的 AIGC 图像检测
发现 AIGC 检测器会学到与初始噪声相关的捷径,提出 On-Manifold 对抗训练并构建 GenImage++ 基准,显著提升对未见生成器的跨生成器检测性能。
- 会议论文NeurIPS 2025
基于贝叶斯数据调度器的 LLM 有害微调自适应防御
提出 BDS,把有害微调防御建模为贝叶斯推断,学习每个数据点的安全属性后加权微调,无需攻击模拟即可自适应防御,效果达到 SOTA。
- 会议论文NeurIPS 2025
通过跨模态对齐增强 CLIP 的对抗鲁棒性
提出免训练的 COLA,用最优传输恢复对抗扰动下的图文对齐,在 14 个零样本基准上,PGD 攻击下 ImageNet 平均提升 6.7%。
- 会议论文NeurIPS 2025
SeCon-RAG:面向可信 RAG 的两阶段语义过滤与无冲突框架
针对 RAG 语料投毒与污染攻击,提出两阶段语义过滤与冲突过滤防御,在保留有用知识的同时提升鲁棒性,优于现有防御。
- 会议论文NeurIPS 2025
大语言模型的安全深度:马尔可夫链视角
提出安全深度概念,用马尔可夫链推导最优安全深度,并以循环群增强提升六个 LLM 的安全分数,发现更大集成宽度可弥补较浅对齐。
- 会议论文NeurIPS 2025
通过缓解分类复杂度实现鲁棒图凝聚
发现图凝聚在原图受污染时性能显著下降,提出 MRGC,用流形约束使凝聚图保持低分类复杂度,在多种对抗攻击下保持鲁棒。
- 会议论文NeurIPS 2025
SAFEPATH:通过早期对齐防止思维链中的有害推理
微调推理模型在推理开头输出 8 token 安全引导语,在 R1-Distill-Llama-8B 上最多减少 90% 有害回答、拦截 83.3% 越狱,计算量远低于基线。
- 会议论文NeurIPS 2025
仅用负样本从文生图模型中移除概念
Clipout 随机裁剪嵌入单元并用对比目标,仅凭自举生成的负样本,无需重训即可移除隐私、版权或有害概念,效果优于现有方法。
- 会议论文NeurIPS 2025
BlurGuard:增强图像保护以抵御 AI 编辑的简单方法
对保护性对抗噪声施加自适应分区域高斯模糊,使其更难被 JPEG 压缩等噪声还原技术消除,提升图像抗 AI 编辑的最差情况保护效果。
- 会议论文NeurIPS 2025
AdaptDel:面向可证明鲁棒性的自适应删除率随机平滑
针对编辑距离扰动下的序列分类,提出随输入动态调整删除率的随机平滑认证方法,在 NLP 任务上认证区域中位基数大幅提升。
- 会议论文NeurIPS 2025
连接对称性与鲁棒性:等变性在增强对抗鲁棒性中的作用
在 CNN 中嵌入旋转和尺度等变层,无需对抗训练即在 FGSM 和 PGD 攻击下提升鲁棒性,并给出理论分析。
- 会议论文NeurIPS 2025
文生图扩散模型中的连续概念移除
提出 CCRT,用知识蒸馏和遗传算法生成的提示约束图文对齐,在连续移除版权或不良概念时保持图像质量。
- 会议论文NeurIPS 2025
MetaDefense:在生成前与生成中防御微调式越狱攻击
训练 LLM 在生成前判断查询、生成中监控部分回复的有害性以提前终止,对已见与未见攻击模板均优于现有防御。
- 会议论文NeurIPS 2025
脆弱数据感知的对抗训练
提出 VDAT,基于间隔衡量样本脆弱性并过滤训练数据,在 CIFAR 与 ImageNet-1K 上效率最高提升 76%,同时提高自然与对抗精度。
- 会议论文NeurIPS 2025
CURE:基于正交表示编辑的扩散模型概念遗忘
提出免训练的权重空间概念遗忘方法,用 SVD 谱擦除器在 2 秒内移除不安全、版权或身份概念,并对红队攻击更稳健。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
Phantom:异构 TEE 与 GPU 系统中保护隐私的 DNN 模型混淆
用强化学习添加轻量混淆层,使未授权方准确率降到接近随机,抵御模型窃取与微调攻击,并在 SGX2 与 GPU 上降低 35% 延迟。
- 会议论文USENIX Security 2025
理解并增强 DNN 模型所有权验证中训练证明(PoT)的安全性
对 PoT 方案做形式化攻击建模,推导通用区分准则并据此构造 PoT 方案,能抵御已攻破现有方案的攻击。
- 会议论文USENIX Security 2025
“因违反内容政策无法撰写”:生成式 AI 产品的内容审核政策与用户体验
分析 14 个生成式 AI 在线工具的审核政策及 Reddit 用户反馈,发现审核能拦截恶意生成,但失败与事后支持常令用户受挫。
- 会议论文USENIX Security 2025
THEMIS:面向部署后端侧深度学习模型的实用知识产权保护
自动重构端侧只读模型的可写版本并嵌入水印以防模型窃取,在 403 个真实 App 上成功率 81.14%。
- 会议论文USENIX Security 2025
用 PANTS 增强 ML 网络流量分类器的鲁棒性
PANTS 结合对抗 ML 与 SMT 求解器生成对抗输入,并用于对抗训练,找到对抗输入的概率优于基线,鲁棒性提升 52.7%。
- 会议论文USENIX Security 2025
AGNNCert:以确定性认证防御图神经网络的任意扰动
首个针对边、节点和节点特征任意扰动的 GNN 确定性认证防御,适用于节点与图分类,并优于现有认证防御。
- 会议论文USENIX Security 2025
VAPD:具备对抗鲁棒性的 PDF 恶意软件取证异常检测模型
基于重构误差的异常检测模型,用于识别恶意 PDF 并定位异常区域,准确率 99.54%,在四种对抗攻击框架下鲁棒性优于现有工作。