全部动态
论文与会议论文
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2025
眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击
利用 attention sink 生成可迁移的视觉对抗输入诱发幻觉,在 6 个 MLLM 及 GPT-4o、Gemini 1.5 上有效。
- 会议论文USENIX Security 2025
面向云端模型训练的任务导向训练数据隐私保护
为上传数据加入对抗优化噪声,实现任务级使用控制:阻止未授权训练,目标任务精度仅下降约 1.8%。
- 会议论文USENIX Security 2025
锐度感知初始化:从基本原理改进差分隐私机器学习
提出 SAI 两阶段训练,通过更平坦的损失面缓解 DP 噪声影响,在 CIFAR-10(ε=1)上提升超过 6% 准确率。
- 会议论文USENIX Security 2025
SoK:针对机器学习模型的数据重建攻击——定义、度量与基准
为视觉领域的数据重建攻击提出统一分类与形式化定义、量化度量及用 LLM 辅助的视觉评估,并建立评测基准。
- 会议论文USENIX Security 2025
当翻译器拒绝翻译:针对语音翻译系统的新型攻击
提出 untranslation 攻击,诱使语音翻译系统输出源语言内容而非译文,扰动预算 0.001 时成功率达 87.5%,并扩展为物理世界通用扰动攻击。
- 会议论文USENIX Security 2025
NeuroScope:基于动态分析逆向边缘设备上的深度神经网络
用动态分析和机器学习逆向 DNN 二进制,支持多种编译器与平台,可恢复专有模型并支撑灰盒对抗攻击。
- 会议论文USENIX Security 2025
利用良性提示从文生图模型主动生成不安全图像
研究通过投毒篡改文生图模型,使良性提示生成不安全图像,分析副作用成因并提出兼顾隐蔽性与效果的投毒方法。
- 会议论文USENIX Security 2025
从风险到韧性:评估并缓解联邦学习中的数据重建攻击风险
提出 InvLoss 量化数据重建攻击风险上界,开发风险估计器 InvRE 与两种自适应噪声防御。
- 会议论文USENIX Security 2025
CertTA:面向学习型流量分析的实用认证鲁棒性
提出多模态平滑机制,首次为流量分析模型提供针对多模态对抗扰动的认证鲁棒性,在六个模型上强于现有方法。
- 会议论文USENIX Security 2025
EmbedX:针对大语言模型的基于嵌入的跨触发器后门攻击
用连续嵌入向量作为软触发器,将多个 token 映射到同一后门通路,并以潜在对抗机制保证隐蔽性,在四个 LLM 上有效且保持可用性。
- 会议论文USENIX Security 2025
VoiceWukong:深度伪造语音检测基准
构建含 41 万余条中英文深伪语音的基准,评测 12 个检测器,最佳 EER 为 13.50%,其余均超 20%,真实场景下性能大幅下降;MLLM 无检测能力。
- 会议论文USENIX Security 2025
PRSA:针对真实提示服务的提示窃取攻击
提出 PRSA 攻击框架,仅凭少量输入输出推断提示意图并复现功能,在提示市场攻击成功率由 17.8% 升至 46.1%,并给出两种防御思路。
- 会议论文USENIX Security 2025
CertPHash:通过鲁棒训练实现可认证的感知哈希
提出首个可认证感知哈希系统,用抗规避、抗碰撞与功能性三项优化项训练,对规避和碰撞攻击给出可证明保证,并在违规内容检测中表现良好。
- 会议论文USENIX Security 2025
基于 LLM 约束求解的混合语言处理器模糊测试
HLPFuzz 用 LLM 求解复杂约束,在 9 个语言处理器中发现 52 个 bug,覆盖率最高领先 190%。
- 会议论文USENIX Security 2025
无数据的模型相关攻击:释放生成式 AI 的潜力
利用生成式 AI 在无数据、黑盒条件下发动模型提取、成员推断与模型反演攻击,效果可比拥有训练数据和参数的白盒基线。
- 会议论文USENIX Security 2025
数据复制:机器遗忘中的一种多用途攻击范式
攻击者复制训练子集后请求遗忘,发现重训练在某些条件下失效、遗忘会导致模型退化,且近重复样本可绕过去重检测。
- 会议论文USENIX Security 2025
跨模态提示反演:统一针对文本与图像生成模型的威胁
提出统一的提示反演方法,先训练反演模型再用强化学习微调,可从输出重建文本和图像模型的提示,并扩展到视频,优于各自的最优方法。
- 会议论文USENIX Security 2025
留意不起眼之处:揭示对齐 LLM 拒答边界中的隐藏弱点
发现追加多个 eos token 会造成上下文分割并使输入逼近拒答边界,可提升 8 种越狱方法在 16 个开源模型上的成功率,主流商用 API 同样受影响。
- 会议论文USENIX Security 2025
恶意 LLM 对话 AI 诱使用户泄露个人信息
对502名参与者的对照试验表明,恶意设计的对话 AI 比良性 AI 套取更多个人信息,其中利用隐私社会属性的策略最有效且风险感知最低。
- 会议论文USENIX Security 2025
激活近似会给对齐 LLM 带来安全漏洞:全面分析与防御
首次系统评估七种激活近似技术,发现十个对齐模型均出现安全退化,并提出 QuadA 方法缓解。
- 会议论文USENIX Security 2025
SOFT:选择性数据混淆保护 LLM 微调免受成员推断攻击
先系统评估微调 LLM 对 MIA 的脆弱性,发现攻击利用微调中的损失下降,再提出 SOFT 选择性混淆数据,在六个领域平衡隐私与性能。
- 会议论文USENIX Security 2025
用 LLM 合成输入生成器实现低成本、全面的非文本输入 fuzzing
G²FUZZ 让 LLM 合成并变异 Python 输入生成器,再由 AFL++ 做局部变异;在覆盖率和找 bug 上优于现有工具,发现 10 个新 bug,3 个获 CVE。
- 会议论文USENIX Security 2025
利用任务级漏洞:LLM 的自动越狱攻击与防御基准
提出基于知识分解的任务级越狱,不依赖特定提示或 token,抗重新对齐能力更强,成功率比 SOTA 高约 10%,并据此构建防御评测基准。
- 会议论文USENIX Security 2025
JBShield:通过激活概念分析与操控防御 LLM 越狱攻击
基于线性表示假设分析越狱机制,提出同时检测并调整隐层表示的 JBShield,平均检测准确率 0.95,攻击成功率从 61% 降至 2%。