全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
哈密顿生成框架下的结构化多步越狱
提出结构化越狱攻击SJA,通过双曲空间哈密顿动力学将有害问题分解为无害子问题序列并融合隐蔽叙事,有效绕过安全对齐并重构有害答案。
- 会议论文ICML 2026
视觉 token 压缩下大型视觉语言模型的对抗鲁棒性
指出现有编码器攻击因优化与推理不匹配而低估压缩后 LVLM 的脆弱性,提出 CAGE 使扰动优化与压缩推理对齐,在多种压缩机制下鲁棒准确率更低。
- 会议论文ICML 2026
MADA-Attack:针对视觉语言模型的可迁移多模态注意力分散对抗攻击
针对多模态大模型提出多模态注意力分散对抗攻击框架,通过操纵语义标记与联合优化嵌入损失,实现高迁移性的通用对抗扰动。
- 会议论文ICML 2026
基于组合技能的 LLM 攻击博弈论分析
形式化攻击者借组合技能隐藏意图与防御者的博弈,刻画均衡并指出攻击方固有优势,推导最优防御,实证攻击强于现有方法。
- 会议论文ICML 2026
Furina:基于分片不确定性驱动的拒答不稳定性越狱攻击
揭示大模型安全拒答存在不稳定性区间,提出无需针对模型优化的越狱攻击Furina,通过分片提示放大不确定性并降低内部安全激活,在HarmBench等基准上超越现有基线。
- 会议论文ICML 2026
剖析安全回路:面向VLM可迁移对抗攻击的神经元干预
揭示VLM安全表征集中于特定中间神经回路,提出安全回路干预攻击(SCIA)通过抑制防御回路并放大可迁移回路,显著提升对黑盒VLM的越狱攻击效果。
- 会议论文ICML 2026
VERA-V:基于变分推断的视觉语言模型越狱框架
把多模态越狱发现建模为图文提示的联合后验学习,训练轻量攻击器采样;在 HarmBench 和 HADES 上优于基线,GPT-4o 上 ASR 最高提升 53.75%。
- 会议论文ICML 2026
安全与保真度权衡:间接提示注入防御的隐性代价
指出间接提示注入防御因抑制不可信文本会破坏翻译等保真任务,构建了SecFid基准以解耦执行、忽略与数据处理行为,揭示了两者间的权衡。
- 会议论文ICML 2026
当提示变为视觉:针对大型图像编辑模型的视觉中心越狱攻击
提出首个纯视觉输入的图像编辑越狱攻击VJA及基准IESBench,揭示主流商业模型高达80.9%的被越狱风险,并提出了基于反思多模态推理的免训练防御。
- 会议论文ICML 2026
沿结构传播扰动:面向异构表格数据的似然约束对抗攻击
提出白盒攻击 LCSA,用神经结构因果模型推断特征依赖并沿下游传播扰动,在 50 种配置中 45 种优于基线,对抗样本结构一致性与迁移性更好。
- 会议论文ICML 2026
TRAP:利用对抗补丁劫持VLA思维链推理
揭示思维链为VLA具身模型引入行为劫持风险,提出首个针对CoT推理的物理对抗补丁攻击TRAP,可在现实中诱导机器人执行对抗指定行为。
- 会议论文NDSS 2026
从因果视角增强越狱攻击与防御
提出 Causal Analyst,用因果发现找出提示特征中导致越狱的直接原因,并据此提升攻击成功率、改进护栏对混淆恶意意图的识别。
- 会议论文NDSS 2026
函数内联及其对基于 ML 的二进制分析的安全影响
系统评估 20 个模型在极端函数内联下的鲁棒性,发现内联可影响模型行为并被用于构造规避型二进制变体。
- 会议论文NDSS 2026
针对基于 ML 的恶意流量检测系统的硬标签黑盒规避攻击
NetMasquerade 用强化学习与 Traffic-BERT 让攻击流量模仿良性流量,在 80 种场景下规避 6 种检测方法,成功率超 96.65%。
- 会议论文NDSS 2026
利用注意力防御大语言模型间接提示注入攻击
提出Rennervate利用细粒度注意力特征检测并清理间接提示注入,在五个模型和六个数据集上优于15种防御方法。
- 会议论文NDSS 2026
超越越狱:LLM应用能力边界模糊带来的风险
研究发现199个LLM应用中有178个可能受能力升级或降级影响,17个无需对抗改写即可执行恶意任务。
- 会议论文NDSS 2026
基于自监督学习的数据集缩减与水印移除:模型提取攻击
提出查询高效的模型提取框架 SSLExtraction,在特征空间贪心随机游走选取查询,在复制模型的同时移除黑盒水印,显著降低查询成本。
- 会议论文NDSS 2026
DUALBREACH:基于目标驱动初始化与多目标优化的高效双重越狱
同时攻破 LLM 与 Guardrail 的双重越狱框架,对受 LlamaGuard-3 保护的 GPT-4 平均成功率 93.67%,并提出 EGUARD 集成防御。
- 会议论文NDSS 2026
NeuroStrike:针对对齐 LLM 的神经元级攻击
定位并剪除安全神经元以关闭安全机制,在 20 多个开源模型上平均攻击成功率 76.9%,并可迁移到黑盒模型。
- 会议论文NDSS 2026
ObliInjection:针对多源数据 LLM Agent 的顺序无关提示注入攻击
在攻击者不知道各数据片段顺序、只控制其中一段的情况下,用顺序无关损失优化注入,在 12 个 LLM 上效果显著。
- 会议论文NDSS 2026
Odysseus:用双重隐写术越狱商用多模态 LLM 系统
把恶意查询和响应隐写进正常图像以绕过输入输出过滤,对 GPT-4o、Gemini、Grok-3 等攻击成功率最高达 99%。
- 会议论文NDSS 2026
针对 LLM Agent 工具选择的提示注入攻击
ToolHijacker 向工具库注入恶意工具文档以操纵工具选择,显著优于现有攻击,且多种现有防御均不足。
- 会议论文NDSS 2026
近红外域中的定向物理逃逸攻击
提出低成本的定向红外对抗扰动攻击,并设计分割检测方法实现高效防御。
- 会议论文NDSS 2026
ThinkTrap:利用无限思考攻击黑盒LLM服务
提出黑盒输入优化攻击,使LLM陷入超长推理循环,显著降低服务吞吐甚至导致服务失效。