全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NeurIPS 2025
CURE:基于正交表示编辑的扩散模型概念遗忘
提出免训练的权重空间概念遗忘方法,用 SVD 谱擦除器在 2 秒内移除不安全、版权或身份概念,并对红队攻击更稳健。
- 会议论文NeurIPS 2025
利用公开数据的私有零阶优化
提出 PAZO,用公开数据引导差分隐私零阶梯度估计,在视觉与文本任务上隐私-效用权衡更优,运行最多快 16 倍。
- 会议论文IEEE S&P 2025
BAIT:通过反演攻击目标扫描大语言模型后门
- 会议论文USENIX Security 2025
虚假隐私的生成数据:用生成数据微调 LLM 的隐藏风险
实证发现用 LLM 生成数据微调并不更私密:Pythia 的 PII 提取成功率上升超 20%,自指令微调后 MIA 的 ROC-AUC 提升超 40%。
- 会议论文USENIX Security 2025
Cloak, Honey, Trap:针对 LLM Agent 的主动防御
利用 LLM 的偏差、记忆限制等弱点,以伪装、蜜罐 token 和陷阱对抗自动渗透测试 Agent,在 11 台 CTF 机器上 100% 成功,并开源 CHeaT 工具。
- 会议论文USENIX Security 2025
Phantom:异构 TEE 与 GPU 系统中保护隐私的 DNN 模型混淆
用强化学习添加轻量混淆层,使未授权方准确率降到接近随机,抵御模型窃取与微调攻击,并在 SGX2 与 GPU 上降低 35% 延迟。
- 会议论文USENIX Security 2025
释放差分隐私零阶优化在 LLM 微调中的潜力
提出 DP-AggZO,缓解裁剪造成的偏差,在相同隐私约束下获得更好的收敛率与模型效用。
- 会议论文USENIX Security 2025
SoK:联邦学习中的梯度反演攻击
系统梳理梯度反演攻击的威胁模型、分类、防御机制与评估指标,并指出关键挑战与未来方向。
- 会议论文USENIX Security 2025
理解并增强 DNN 模型所有权验证中训练证明(PoT)的安全性
对 PoT 方案做形式化攻击建模,推导通用区分准则并据此构造 PoT 方案,能抵御已攻破现有方案的攻击。
- 会议论文USENIX Security 2025
ELFuzz:通过 LLM 驱动的 fuzzer 空间合成实现高效输入生成
用 LLM 驱动的覆盖率引导进化自动合成生成式 fuzzer,覆盖率最高提升 434.8%,并在 cvc5 上发现 5 个 0-day。
- 会议论文USENIX Security 2025
StruQ:用结构化查询防御提示注入
将提示与数据分为两个通道,并微调模型只遵循提示部分的指令,显著提升对提示注入的抵抗力,对效用几乎无影响。
- 会议论文USENIX Security 2025
基于增强少样本学习的 LLM PII 高效提取
提出无需微调或越狱的少样本 PII 提取方法,非定向提取成功率 48.9%、每条约 0.012 美元,定向提取比现有方法高 10% 至 60%。
- 会议论文USENIX Security 2025
Bot 会窥探:群聊中聊天机器人的隐私风险发现与缓解
分析发现群聊 chatbot 常读取远超所需的消息,并可跨群关联用户;提出 SnoopGuard 协议,支持选择性消息访问和发送者匿名,同时保持端到端安全。
- 会议论文USENIX Security 2025
SoK:合成图像能否取代真实数据?合成图像生成的效用与隐私综述
系统梳理合成图像生成方法、隐私攻击与缓解,并用成员推断攻击建立基准,评估合成数据的效用与隐私权衡。
- 会议论文USENIX Security 2025
深度带来虚假的隐私感:LLM 内部状态反演
提出四种针对 LLM 内部状态的反演攻击,能从中间层还原输入,如 Llama-3 中间层还原长医疗提示 F1 达 86.88,现有防御无法完全阻止。
- 会议论文USENIX Security 2025
SoK:联邦学习中的梯度泄露
系统梳理梯度反演攻击并在多种设置下评估,发现其在实际训练中受限、脆弱且易于防御。
- 会议论文USENIX Security 2025
增强梯度泄露攻击:真实联邦学习场景下的数据重建
提出 FEDLEAK,用部分梯度匹配和梯度正则化,在真实联邦学习设置下仍能高保真重建客户端数据,揭示显著隐私漏洞。
- 会议论文USENIX Security 2025
Refiner:抵御联邦学习梯度泄露攻击的数据精炼防御
不扰动梯度而是构造与原始数据语义差异大、梯度对齐的鲁棒数据,在多个数据集上有效抵御最先进的梯度泄露攻击。
- 会议论文USENIX Security 2025
LightShed:击破基于扰动的图像版权保护
提出通用去毒攻击,识别并去除 NightShade、Glaze 等保护扰动,检测 NightShade 的 TPR 达 99.98%,揭示现有保护方案的局限。
- 会议论文USENIX Security 2025
“因违反内容政策无法撰写”:生成式 AI 产品的内容审核政策与用户体验
分析 14 个生成式 AI 在线工具的审核政策及 Reddit 用户反馈,发现审核能拦截恶意生成,但失败与事后支持常令用户受挫。
- 会议论文USENIX Security 2025
我知道你说了什么:本地 LLM 推理中的硬件缓存侧信道
发现本地 LLM 推理中 token 值与位置的缓存侧信道泄露,设计无需特权的窃听攻击,还原输入输出文本的余弦相似度约 98%。
- 会议论文USENIX Security 2025
分析 AI 脱衣应用生态
系统研究20个热门 AI 脱衣网站的定位、宣传功能与变现基础设施,为相关政策与技术讨论提供数据。
- 会议论文USENIX Security 2025
PAPILLON:基于模糊测试的高效隐蔽 LLM 越狱
提出从空种子池出发的黑盒模糊测试越狱框架,对 GPT-3.5、GPT-4、Gemini-Pro 成功率超 90%、80%、74%,提示更短且语义连贯。
- 会议论文USENIX Security 2025
Topic-FlipRAG:面向 RAG 模型的主题导向对抗性观点操纵攻击
两阶段攻击通过对抗扰动系统性地扭转 RAG 在特定主题上的输出观点,现有缓解方法难以防御。