全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文USENIX Security 2025
CertTA:面向学习型流量分析的实用认证鲁棒性
提出多模态平滑机制,首次为流量分析模型提供针对多模态对抗扰动的认证鲁棒性,在六个模型上强于现有方法。
- 会议论文USENIX Security 2025
EmbedX:针对大语言模型的基于嵌入的跨触发器后门攻击
用连续嵌入向量作为软触发器,将多个 token 映射到同一后门通路,并以潜在对抗机制保证隐蔽性,在四个 LLM 上有效且保持可用性。
- 会议论文USENIX Security 2025
VoiceWukong:深度伪造语音检测基准
构建含 41 万余条中英文深伪语音的基准,评测 12 个检测器,最佳 EER 为 13.50%,其余均超 20%,真实场景下性能大幅下降;MLLM 无检测能力。
- 会议论文USENIX Security 2025
PRSA:针对真实提示服务的提示窃取攻击
提出 PRSA 攻击框架,仅凭少量输入输出推断提示意图并复现功能,在提示市场攻击成功率由 17.8% 升至 46.1%,并给出两种防御思路。
- 会议论文USENIX Security 2025
CertPHash:通过鲁棒训练实现可认证的感知哈希
提出首个可认证感知哈希系统,用抗规避、抗碰撞与功能性三项优化项训练,对规避和碰撞攻击给出可证明保证,并在违规内容检测中表现良好。
- 会议论文USENIX Security 2025
基于 LLM 约束求解的混合语言处理器模糊测试
HLPFuzz 用 LLM 求解复杂约束,在 9 个语言处理器中发现 52 个 bug,覆盖率最高领先 190%。
- 会议论文USENIX Security 2025
无数据的模型相关攻击:释放生成式 AI 的潜力
利用生成式 AI 在无数据、黑盒条件下发动模型提取、成员推断与模型反演攻击,效果可比拥有训练数据和参数的白盒基线。
- 会议论文USENIX Security 2025
数据复制:机器遗忘中的一种多用途攻击范式
攻击者复制训练子集后请求遗忘,发现重训练在某些条件下失效、遗忘会导致模型退化,且近重复样本可绕过去重检测。
- 会议论文USENIX Security 2025
跨模态提示反演:统一针对文本与图像生成模型的威胁
提出统一的提示反演方法,先训练反演模型再用强化学习微调,可从输出重建文本和图像模型的提示,并扩展到视频,优于各自的最优方法。
- 会议论文USENIX Security 2025
留意不起眼之处:揭示对齐 LLM 拒答边界中的隐藏弱点
发现追加多个 eos token 会造成上下文分割并使输入逼近拒答边界,可提升 8 种越狱方法在 16 个开源模型上的成功率,主流商用 API 同样受影响。
- 会议论文USENIX Security 2025
恶意 LLM 对话 AI 诱使用户泄露个人信息
对502名参与者的对照试验表明,恶意设计的对话 AI 比良性 AI 套取更多个人信息,其中利用隐私社会属性的策略最有效且风险感知最低。
- 会议论文USENIX Security 2025
激活近似会给对齐 LLM 带来安全漏洞:全面分析与防御
首次系统评估七种激活近似技术,发现十个对齐模型均出现安全退化,并提出 QuadA 方法缓解。
- 会议论文USENIX Security 2025
SOFT:选择性数据混淆保护 LLM 微调免受成员推断攻击
先系统评估微调 LLM 对 MIA 的脆弱性,发现攻击利用微调中的损失下降,再提出 SOFT 选择性混淆数据,在六个领域平衡隐私与性能。
- 会议论文USENIX Security 2025
用 LLM 合成输入生成器实现低成本、全面的非文本输入 fuzzing
G²FUZZ 让 LLM 合成并变异 Python 输入生成器,再由 AFL++ 做局部变异;在覆盖率和找 bug 上优于现有工具,发现 10 个新 bug,3 个获 CVE。
- 会议论文USENIX Security 2025
利用任务级漏洞:LLM 的自动越狱攻击与防御基准
提出基于知识分解的任务级越狱,不依赖特定提示或 token,抗重新对齐能力更强,成功率比 SOTA 高约 10%,并据此构建防御评测基准。
- 会议论文USENIX Security 2025
JBShield:通过激活概念分析与操控防御 LLM 越狱攻击
基于线性表示假设分析越狱机制,提出同时检测并调整隐层表示的 JBShield,平均检测准确率 0.95,攻击成功率从 61% 降至 2%。
- 会议论文USENIX Security 2025
自解释对抗图像
提出针对视觉语言模型的跨模态间接注入攻击,图像内含隐藏元指令,可操控模型回答的风格与观点。
- 会议论文USENIX Security 2025
以火攻火:面向对抗性 Android 恶意软件检测的持续攻击防御
提出 HagDe,对样本沿梯度上升方向迭代扰动,利用对抗样本损失异常上升来检测,对 AdvDroidZero 和 BagAmmo 防御效果分别达 88.5% 和 90.7%。
- 会议论文USENIX Security 2025
Atkscopes:针对感知哈希的多分辨率对抗扰动统一攻击
提出多分辨率扰动,统一攻破 PhotoDNA、PDQ、NeuralHash 与 pHash,可实现规避或触发监管,收敛效率明显提升。
- 会议论文USENIX Security 2025
USD:基于场景图的文生图模型 NSFW 内容检测
利用场景图生成与分类识别图像中的有害实体与关系,F1 平均高出基线 95.52%,并可定位并移除 95% 的有害内容。
- 会议论文USENIX Security 2025
SafeSpeech:针对恶意语音合成的鲁棒通用语音保护
提出 SPEC 技术,在上传前给语音嵌入不可察觉扰动以阻止声音克隆,对多种合成模型有效且能抵御自适应对手,可实时运行。
- 会议论文USENIX Security 2025
神经隐身斗篷:通过被攻陷的 AI 图像信号处理在图像中隐藏攻击者
通过数据投毒在 AI 驱动的 ISP 模型中植入后门,使穿特定斗篷的人在输出图像中被完全抹除,并在真实场景中验证。
- 会议论文USENIX Security 2025
AudioMarkNet:用于深度伪造语音检测的音频水印
在原始语音中嵌入水印,阻止其被用于 TTS 说话人自适应,从而可检出开源和商用 TTS 生成的伪造语音,并对自适应攻击保持鲁棒。
- 会议论文USENIX Security 2025
PoisonedRAG:针对大模型检索增强生成的知识污染攻击
向知识库注入少量恶意文本即可诱导 LLM 输出攻击者指定答案,每个目标问题注入 5 条文本攻击成功率达 90%,现有防御不足。