全部动态
从来源,看到研究的联系
图中 6 条 · 本页 9 条 · 共 921 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 2
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。
点选节点,展开一条线索
本页材料
完整标题与摘要 · 9 条- 会议论文USENIX Security 2025
暴露护栏:逆向并越狱 DALL·E 文生图流水线中的安全过滤器
用计时侧信道逆向 DALL·E 2/3 的级联安全过滤器,并利用否定表达与低资源语言漏洞实现越狱。
- 会议论文USENIX Security 2025
从威胁到信任:利用注意力机制攻防协同感知
SOMBRA 利用注意力融合实施隐蔽的目标移除攻击,成功率达 99%;LUCIA 以可信度感知注意力防御,大幅降低移除率。
- 会议论文USENIX Security 2025
TracLLM:长上下文 LLM 归因的通用框架
提出上下文溯源框架,定位长上下文中导致输出的文本,可用于提示注入等攻击的事后取证,效率与准确性优于现有归因方法。
- 会议论文USENIX Security 2025
眼中的幻象:仅利用注意力汇聚对多模态大模型的幻觉攻击
利用 attention sink 生成可迁移的视觉对抗输入诱发幻觉,在 6 个 MLLM 及 GPT-4o、Gemini 1.5 上有效。
- 会议论文USENIX Security 2025
当翻译器拒绝翻译:针对语音翻译系统的新型攻击
提出 untranslation 攻击,诱使语音翻译系统输出源语言内容而非译文,扰动预算 0.001 时成功率达 87.5%,并扩展为物理世界通用扰动攻击。
- 会议论文USENIX Security 2025
留意不起眼之处:揭示对齐 LLM 拒答边界中的隐藏弱点
发现追加多个 eos token 会造成上下文分割并使输入逼近拒答边界,可提升 8 种越狱方法在 16 个开源模型上的成功率,主流商用 API 同样受影响。
- 会议论文USENIX Security 2025
利用任务级漏洞:LLM 的自动越狱攻击与防御基准
提出基于知识分解的任务级越狱,不依赖特定提示或 token,抗重新对齐能力更强,成功率比 SOTA 高约 10%,并据此构建防御评测基准。
- 会议论文USENIX Security 2025
自解释对抗图像
提出针对视觉语言模型的跨模态间接注入攻击,图像内含隐藏元指令,可操控模型回答的风格与观点。
- 会议论文USENIX Security 2025
Atkscopes:针对感知哈希的多分辨率对抗扰动统一攻击
提出多分辨率扰动,统一攻破 PhotoDNA、PDQ、NeuralHash 与 pHash,可实现规避或触发监管,收敛效率明显提升。