全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NDSS 2026
面向文本到图像扩散模型的有效提示窃取攻击
提出无需训练的搜索式提示窃取方法,可从多种平台图像中提取生成提示并提升攻击成功率。
- 会议论文NDSS 2026
当缓存投毒遇上LLM系统:语义缓存投毒及其对策
发现攻击者可通过注入缓存条目操纵他人获得的LLM响应,并提出改进防御机制。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
突破检索障碍:真实环境中的间接提示注入
构造保证恶意内容被检索的触发片段,在RAG和Agent系统中实现高成功率的端到端间接提示注入。
- 会议论文USENIX Security 2026
SoK:机器学习流水线中的共谋攻击者
提出覆盖训练期与推理期攻击者共谋的框架,给出基于使能因素的判断准则,解释已有工作并实证验证五种未探索的共谋。
- 会议论文USENIX Security 2026
用受控释放提示绕过生产环境中的 Prompt Guard
利用轻量过滤器与主模型的算力不对称,生成过滤器无法解读但目标 LLM 可理解的提示,在四个主流聊天平台上成功,14 个防护模型均难以检测。
- 会议论文USENIX Security 2026
网络安全日志LLM分析中的上下文污染
展示日志中的被动提示注入可隐藏活动、制造误报并外泄信息,并评估分层防御的缓解效果。
- 会议论文USENIX Security 2026
用非定向模态对齐破坏攻击评估视觉语言模型鲁棒性
MABA同时攻击视觉编码和模态对齐环节,在黑盒条件下显著降低多个视觉语言模型的图像描述性能。
- 会议论文USENIX Security 2026
Sirens' Whisper:针对语音驱动 LLM 的不可听近超声越狱
通过近超声信道隐蔽投递语音提示并设计语音感知越狱,在商用模型上非拒答率最高达 0.94,用户研究显示人耳无法察觉。
- 会议论文USENIX Security 2026
具有理论基础的低成本硬标签对抗攻击
论文提出零查询初始化和模式驱动优化,在多种模型与任务上以更低查询成本提升黑盒对抗攻击效果。
- 会议论文USENIX Security 2026
攻击者后手:自适应攻击绕过LLM防御
系统调优多类攻击方法,发现其能以超过90%的成功率绕过12种近期越狱与提示注入防御。
- 会议论文USENIX Security 2026
一颗坏 token 毁掉全局:LLM 故障 token 的评估、检测与修复
证明 glitch token 可绕过安全机制且跨模型迁移,提出 GlitchQuiz 检测与 GlitchEdit 嵌入层编辑,不安全率由 96.36% 降至 2.87%。
- 会议论文USENIX Security 2026
GateBreaker:针对 MoE LLM 的门控引导攻击
定位并禁用 MoE 中集中于少量神经元的安全结构,在八个对齐 MoE 模型上攻击成功率由 7.4% 升至 64.9%,且可跨同族模型迁移。
- 会议论文USENIX Security 2026
守护二维码:揭示对抗性二维码背后的真实非法推广
提出 Adato 检测对抗性二维码图像(AQRI),精确率 98.6%,在 4000 多万张图中发现 68,467 个 AQRI,95.78% 指向恶意 URL。
- 会议论文USENIX Security 2026
BadGraph:针对GraphRAG的结构知识隔离攻击
BadGraph通过注入语义中性的文档扰乱知识图拓扑,降低关键证据召回率和GraphRAG问答性能。
- 会议论文USENIX Security 2026
眼见而 LLM 不见:利用人类感知的对抗文本攻击
提出 HPAA,用排版操纵使有害内容人类可识别而逃过审核,仅 3 次查询即在 13 个审核系统上检出率低于 1%。
- 会议论文USENIX Security 2026
从零到英雄:多模态推荐系统对抗性推广攻击
CREAM协同扰动图像与文本内容操纵推荐排序,使目标商品曝光显著提升并暴露平台经济风险。
- 会议论文USENIX Security 2026
真实世界求职筛选中的提示注入攻击测量
分析约20万份简历,发现约1%含隐蔽提示注入,且多数不含显式指令。
- 会议论文USENIX Security 2026
当记忆成为漏洞:针对文生图系统的多轮越狱攻击
提出 Inception,利用文生图系统的记忆机制,通过分段与递归把恶意意图分散到多轮提示中,攻击成功率超过 SOTA 20.0%,并在商业平台验证。
- 会议论文ACL 2025
多示例攻击中什么最重要?大模型长上下文漏洞实证研究
在最长128K上下文中测试多示例越狱,发现上下文长度是攻击效果的主要因素,重复示例甚至随机文本也能绕过安全措施。
- 会议论文ACL 2025
对抗性分词
发现无需修改有害请求文本,仅改变分词方式即可绕过安全限制,并在三个大模型上验证其攻击效果可与现有先进方法竞争。
- 会议论文ACL 2025
JailbreakRadar:大语言模型越狱攻击综合评估
在九个对齐模型和八种防御下评估17种越狱攻击,建立攻击分类,并发现启发式攻击虽可取得高成功率,却较易被防御缓解。
- 会议论文ACL 2025
大模型知晓自身弱点:通过自然分布偏移揭示安全漏洞
提出ActorBreaker,利用与有害内容语义相关的多轮提示绕过防护;攻击在多样性、效果与效率上优于既有方法,衍生训练数据可增强鲁棒性。
- 会议论文ACL 2025
LLM 能欺骗 CLIP 吗?以文本更新评测多模态组合漏洞
提出 MAC 基准,用语言模型生成欺骗性文本揭示多模态表征的组合漏洞,并通过自训练同时提高攻击成功率与样本多样性。