全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文NDSS 2026
函数内联及其对基于 ML 的二进制分析的安全影响
系统评估 20 个模型在极端函数内联下的鲁棒性,发现内联可影响模型行为并被用于构造规避型二进制变体。
- 会议论文NDSS 2026
针对基于 ML 的恶意流量检测系统的硬标签黑盒规避攻击
NetMasquerade 用强化学习与 Traffic-BERT 让攻击流量模仿良性流量,在 80 种场景下规避 6 种检测方法,成功率超 96.65%。
- 会议论文NDSS 2026
超越越狱:LLM应用能力边界模糊带来的风险
研究发现199个LLM应用中有178个可能受能力升级或降级影响,17个无需对抗改写即可执行恶意任务。
- 会议论文NDSS 2026
基于自监督学习的数据集缩减与水印移除:模型提取攻击
提出查询高效的模型提取框架 SSLExtraction,在特征空间贪心随机游走选取查询,在复制模型的同时移除黑盒水印,显著降低查询成本。
- 会议论文NDSS 2026
DUALBREACH:基于目标驱动初始化与多目标优化的高效双重越狱
同时攻破 LLM 与 Guardrail 的双重越狱框架,对受 LlamaGuard-3 保护的 GPT-4 平均成功率 93.67%,并提出 EGUARD 集成防御。
- 会议论文NDSS 2026
NeuroStrike:针对对齐 LLM 的神经元级攻击
定位并剪除安全神经元以关闭安全机制,在 20 多个开源模型上平均攻击成功率 76.9%,并可迁移到黑盒模型。
- 会议论文NDSS 2026
Odysseus:用双重隐写术越狱商用多模态 LLM 系统
把恶意查询和响应隐写进正常图像以绕过输入输出过滤,对 GPT-4o、Gemini、Grok-3 等攻击成功率最高达 99%。
- 会议论文NDSS 2026
近红外域中的定向物理逃逸攻击
提出低成本的定向红外对抗扰动攻击,并设计分割检测方法实现高效防御。
- 会议论文NDSS 2026
ThinkTrap:利用无限思考攻击黑盒LLM服务
提出黑盒输入优化攻击,使LLM陷入超长推理循环,显著降低服务吞吐甚至导致服务失效。
- 会议论文NDSS 2026
面向文本到图像扩散模型的有效提示窃取攻击
提出无需训练的搜索式提示窃取方法,可从多种平台图像中提取生成提示并提升攻击成功率。
- 会议论文IEEE S&P 2026
EnchTable:微调大语言模型中的统一安全对齐迁移
- 会议论文USENIX Security 2026
SoK:机器学习流水线中的共谋攻击者
提出覆盖训练期与推理期攻击者共谋的框架,给出基于使能因素的判断准则,解释已有工作并实证验证五种未探索的共谋。
- 会议论文USENIX Security 2026
用受控释放提示绕过生产环境中的 Prompt Guard
利用轻量过滤器与主模型的算力不对称,生成过滤器无法解读但目标 LLM 可理解的提示,在四个主流聊天平台上成功,14 个防护模型均难以检测。
- 会议论文USENIX Security 2026
用非定向模态对齐破坏攻击评估视觉语言模型鲁棒性
MABA同时攻击视觉编码和模态对齐环节,在黑盒条件下显著降低多个视觉语言模型的图像描述性能。
- 会议论文USENIX Security 2026
Sirens' Whisper:针对语音驱动 LLM 的不可听近超声越狱
通过近超声信道隐蔽投递语音提示并设计语音感知越狱,在商用模型上非拒答率最高达 0.94,用户研究显示人耳无法察觉。
- 会议论文USENIX Security 2026
具有理论基础的低成本硬标签对抗攻击
论文提出零查询初始化和模式驱动优化,在多种模型与任务上以更低查询成本提升黑盒对抗攻击效果。
- 会议论文USENIX Security 2026
攻击者后手:自适应攻击绕过LLM防御
系统调优多类攻击方法,发现其能以超过90%的成功率绕过12种近期越狱与提示注入防御。
- 会议论文USENIX Security 2026
一颗坏 token 毁掉全局:LLM 故障 token 的评估、检测与修复
证明 glitch token 可绕过安全机制且跨模型迁移,提出 GlitchQuiz 检测与 GlitchEdit 嵌入层编辑,不安全率由 96.36% 降至 2.87%。
- 会议论文USENIX Security 2026
GateBreaker:针对 MoE LLM 的门控引导攻击
定位并禁用 MoE 中集中于少量神经元的安全结构,在八个对齐 MoE 模型上攻击成功率由 7.4% 升至 64.9%,且可跨同族模型迁移。
- 会议论文USENIX Security 2026
守护二维码:揭示对抗性二维码背后的真实非法推广
提出 Adato 检测对抗性二维码图像(AQRI),精确率 98.6%,在 4000 多万张图中发现 68,467 个 AQRI,95.78% 指向恶意 URL。
- 会议论文USENIX Security 2026
眼见而 LLM 不见:利用人类感知的对抗文本攻击
提出 HPAA,用排版操纵使有害内容人类可识别而逃过审核,仅 3 次查询即在 13 个审核系统上检出率低于 1%。
- 会议论文USENIX Security 2026
从零到英雄:多模态推荐系统对抗性推广攻击
CREAM协同扰动图像与文本内容操纵推荐排序,使目标商品曝光显著提升并暴露平台经济风险。
- 会议论文USENIX Security 2026
当记忆成为漏洞:针对文生图系统的多轮越狱攻击
提出 Inception,利用文生图系统的记忆机制,通过分段与递归把恶意意图分散到多轮提示中,攻击成功率超过 SOTA 20.0%,并在商业平台验证。
- 会议论文ACL 2025
多示例攻击中什么最重要?大模型长上下文漏洞实证研究
在最长128K上下文中测试多示例越狱,发现上下文长度是攻击效果的主要因素,重复示例甚至随机文本也能绕过安全措施。