全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 12 条- 会议论文USENIX Security 2025
GradEscape:针对 AI 生成文本检测器的基于梯度的规避攻击
提出首个基于梯度的 AIGT 检测器规避方法,在多个数据集和两个商用检测器上超过现有规避方法,并给出防御思路。
- 会议论文USENIX Security 2025
Chimera:欺骗图像重拍检测器与深度伪造检测器的数字签名伪造照片
提出端到端攻击 Chimera,用硬件感知的 GAN 补偿器生成带数字签名的伪造图像,同时绕过深度伪造检测和重拍检测,攻击成功率高。
- 会议论文USENIX Security 2025
SoK:动态深度学习系统的效率鲁棒性
首次系统梳理针对动态深度学习系统的效率攻击分类,涵盖三类动态行为,并指出现有防御对这类攻击存在局限。
- 会议论文USENIX Security 2025
Crescendo:多轮 LLM 越狱攻击
提出看似无害、逐步升级对话的多轮越狱 Crescendo 及自动化工具,在多个主流模型上成功率高,并可越狱多模态模型。
- 会议论文USENIX Security 2025
拒答并非选项:通过遗忘学习抹除大语言模型的安全对齐
提出两种利用看似合法的 unlearning 请求破坏安全对齐的攻击,使 LLaMA 有害性平均升高 11 倍,对 GPT-4o 微调服务同样有效。
- 会议论文USENIX Security 2025
暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器
用计时侧信道逆向 DALL·E 2/3 的级联安全过滤器,并利用否定表达与低资源语言漏洞实现越狱。
- 会议论文USENIX Security 2025
从威胁到信任:利用注意力机制攻防协同感知
SOMBRA 利用注意力融合实施隐蔽的目标移除攻击,成功率达 99%;LUCIA 以可信度感知注意力防御,大幅降低移除率。
- 会议论文USENIX Security 2025
眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击
利用 attention sink 生成可迁移的视觉对抗输入诱发幻觉,在 6 个 MLLM 及 GPT-4o、Gemini 1.5 上有效。
- 会议论文USENIX Security 2025
当翻译器拒绝翻译:针对语音翻译系统的新型攻击
提出 untranslation 攻击,诱使语音翻译系统输出源语言内容而非译文,扰动预算 0.001 时成功率达 87.5%,并扩展为物理世界通用扰动攻击。
- 会议论文USENIX Security 2025
留意不起眼之处:揭示对齐 LLM 拒答边界中的隐藏弱点
发现追加多个 eos token 会造成上下文分割并使输入逼近拒答边界,可提升 8 种越狱方法在 16 个开源模型上的成功率,主流商用 API 同样受影响。
- 会议论文USENIX Security 2025
利用任务级漏洞:LLM 的自动越狱攻击与防御基准
提出基于知识分解的任务级越狱,不依赖特定提示或 token,抗重新对齐能力更强,成功率比 SOTA 高约 10%,并据此构建防御评测基准。
- 会议论文USENIX Security 2025
Atkscopes:针对感知哈希的多分辨率对抗扰动统一攻击
提出多分辨率扰动,统一攻破 PhotoDNA、PDQ、NeuralHash 与 pHash,可实现规避或触发监管,收敛效率明显提升。