全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
脆弱数据感知的对抗训练
提出 VDAT,基于间隔衡量样本脆弱性并过滤训练数据,在 CIFAR 与 ImageNet-1K 上效率最高提升 76%,同时提高自然与对抗精度。
- 会议论文NeurIPS 2025
针对对齐大模型的语义表示攻击
提出以语义表示空间为目标的越狱范式及 SRHS 搜索算法,生成语义连贯的对抗提示,在 18 个 LLM 上平均攻击成功率 89.4%。
- 会议论文NeurIPS 2025
LLM 对有害性与拒答的编码是分离的
发现有害性方向与拒答方向相互独立;部分越狱只削弱拒答信号而不改变有害性判断,据此提出对微调攻击鲁棒的 Latent Guard。
- 会议论文NeurIPS 2025
Dual-Flow:通过级联流优化实现可迁移的多目标、实例无关攻击
用级联分布偏移训练得到对抗速度函数,提升多目标生成式对抗攻击的迁移性,如 Inception-v3 到 ResNet-152 成功率提高 34.58%,且更抗防御。
- 会议论文NeurIPS 2025
CURE:基于正交表示编辑的扩散模型概念遗忘
提出免训练的权重空间概念遗忘方法,用 SVD 谱擦除器在 2 秒内移除不安全、版权或身份概念,并对红队攻击更稳健。
- 会议论文NeurIPS 2025
利用公开数据的私有零阶优化
提出 PAZO,用公开数据引导差分隐私零阶梯度估计,在视觉与文本任务上隐私-效用权衡更优,运行最多快 16 倍。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
虚假隐私的生成数据:用生成数据微调 LLM 的隐藏风险
实证发现用 LLM 生成数据微调并不更私密:Pythia 的 PII 提取成功率上升超 20%,自指令微调后 MIA 的 ROC-AUC 提升超 40%。
- 会议论文USENIX Security 2025
Cloak, Honey, Trap:针对 LLM Agent 的主动防御
利用 LLM 的偏差、记忆限制等弱点,以伪装、蜜罐 token 和陷阱对抗自动渗透测试 Agent,在 11 台 CTF 机器上 100% 成功,并开源 CHeaT 工具。
- 会议论文USENIX Security 2025
Phantom:异构 TEE 与 GPU 系统中保护隐私的 DNN 模型混淆
用强化学习添加轻量混淆层,使未授权方准确率降到接近随机,抵御模型窃取与微调攻击,并在 SGX2 与 GPU 上降低 35% 延迟。
- 会议论文USENIX Security 2025
释放差分隐私零阶优化在 LLM 微调中的潜力
提出 DP-AggZO,缓解裁剪造成的偏差,在相同隐私约束下获得更好的收敛率与模型效用。
- 会议论文USENIX Security 2025
SoK:联邦学习中的梯度反演攻击
系统梳理梯度反演攻击的威胁模型、分类、防御机制与评估指标,并指出关键挑战与未来方向。
- 会议论文USENIX Security 2025
理解并增强 DNN 模型所有权验证中训练证明(PoT)的安全性
对 PoT 方案做形式化攻击建模,推导通用区分准则并据此构造 PoT 方案,能抵御已攻破现有方案的攻击。
- 会议论文USENIX Security 2025
ELFuzz:通过 LLM 驱动的 fuzzer 空间合成实现高效输入生成
用 LLM 驱动的覆盖率引导进化自动合成生成式 fuzzer,覆盖率最高提升 434.8%,并在 cvc5 上发现 5 个 0-day。
- 会议论文USENIX Security 2025
StruQ:用结构化查询防御提示注入
将提示与数据分为两个通道,并微调模型只遵循提示部分的指令,显著提升对提示注入的抵抗力,对效用几乎无影响。
- 会议论文USENIX Security 2025
基于增强少样本学习的 LLM PII 高效提取
提出无需微调或越狱的少样本 PII 提取方法,非定向提取成功率 48.9%、每条约 0.012 美元,定向提取比现有方法高 10% 至 60%。
- 会议论文USENIX Security 2025
Bot 会窥探:群聊中聊天机器人的隐私风险发现与缓解
分析发现群聊 chatbot 常读取远超所需的消息,并可跨群关联用户;提出 SnoopGuard 协议,支持选择性消息访问和发送者匿名,同时保持端到端安全。
- 会议论文USENIX Security 2025
SoK:合成图像能否取代真实数据?合成图像生成的效用与隐私综述
系统梳理合成图像生成方法、隐私攻击与缓解,并用成员推断攻击建立基准,评估合成数据的效用与隐私权衡。
- 会议论文USENIX Security 2025
深度带来虚假的隐私感:LLM 内部状态反演
提出四种针对 LLM 内部状态的反演攻击,能从中间层还原输入,如 Llama-3 中间层还原长医疗提示 F1 达 86.88,现有防御无法完全阻止。
- 会议论文USENIX Security 2025
SoK:联邦学习中的梯度泄露
系统梳理梯度反演攻击并在多种设置下评估,发现其在实际训练中受限、脆弱且易于防御。
- 会议论文USENIX Security 2025
增强梯度泄露攻击:真实联邦学习场景下的数据重建
提出 FEDLEAK,用部分梯度匹配和梯度正则化,在真实联邦学习设置下仍能高保真重建客户端数据,揭示显著隐私漏洞。
- 会议论文USENIX Security 2025
Refiner:抵御联邦学习梯度泄露攻击的数据精炼防御
不扰动梯度而是构造与原始数据语义差异大、梯度对齐的鲁棒数据,在多个数据集上有效抵御最先进的梯度泄露攻击。
- 会议论文USENIX Security 2025
LightShed:击破基于扰动的图像版权保护
提出通用去毒攻击,识别并去除 NightShade、Glaze 等保护扰动,检测 NightShade 的 TPR 达 99.98%,揭示现有保护方案的局限。
- 会议论文USENIX Security 2025
“因违反内容政策无法撰写”:生成式 AI 产品的内容审核政策与用户体验
分析 14 个生成式 AI 在线工具的审核政策及 Reddit 用户反馈,发现审核能拦截恶意生成,但失败与事后支持常令用户受挫。