全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
贪心坐标扩散:基于扩散引导的高效且语义连贯对抗攻击
提出贪心坐标扩散攻击框架GCD,利用离散扩散模型的先验引导搜索语义连贯且低困惑度的对抗后缀,在灰盒设置下实现更高越狱攻击成功率并绕过护栏检测。
- 会议论文ICML 2026
OBJVanish:提示驱动生成物理可实现的3D激光雷达隐身物体
提出文本到3D对抗生成框架OBJVanish,通过迭代优化提示词生成物理可实现物体,使六种SOTA激光雷达检测器完全漏检。
- 会议论文ICML 2026
OrchJail:以编排引导的 fuzzing 越狱调用工具的文生图 Agent
指出工具编排是文生图 Agent 的新攻击面,利用成功越狱的工具调用轨迹引导 fuzzing,攻击成功率更高、查询成本更低,并能抵御常见越狱防御。
- 会议论文ICML 2026
Metis:通过自进化元认知策略优化学习越狱 LLM
将越狱建模为对抗性 POMDP 中的推理时策略优化,在 10 个模型上平均 ASR 达 89.2%,token 成本平均降低 8.2 倍。
- 会议论文ICML 2026
MultiBreak:用于评估大模型安全性的多轮越狱评测基准
提出包含超万条多轮对抗提示的越狱基准MultiBreak,通过主动学习扩增高质量攻击样本,揭示了单轮看似无害的意图在多轮对话中更易绕过安全对齐。
- 会议论文ICML 2026
充耳不闻?注意力感知的隐蔽黑盒对抗性音频攻击
提出音乐载体选择算法与注意力感知隐蔽性损失,生成能够欺骗主流语音助手识别攻击指令的黑盒物理对抗音频,显著提升攻击有效性与隐蔽性。
- 会议论文ICML 2026
DDGA:面向视觉语言模型可迁移对抗攻击的 Dirichlet 分布梯度聚合
用可学习 Dirichlet 策略优化对抗演化三角形单纯形上的扰动分布,在图文检索与图像描述上超越现有迁移攻击。
- 会议论文ICML 2026
ImpText:隐式文本推理基准与工具增强框架
针对通过形变、伪装等方式隐藏恶意文字以绕过内容审核的场景,提出 ImpText-Bench,最强闭源模型仅得 35.79%,并提出工具增强的 ImpText-Reader。
- 会议论文ICML 2026
新型“广撒网”越狱攻击威胁大模型安全
提出一种针对多个大模型同时查询以诱导有害输出的“广撒网”越狱场景与定制攻击方法,在无额外防护时攻击成功率可达100%。
- 会议论文ICML 2026
“有人藏了它!”:针对 LLM 检索的查询无关黑盒攻击
用零样本代理 LLM 生成可迁移的注入 token,无需受害查询或模型知识即可操纵 LLM 检索结果,在多个检索器上有效。
- 会议论文ICML 2026
稀疏模型与稀疏安全:混合专家大语言模型中的不安全路由
发现MoE大模型的安全能力具有稀疏性,提出F-SOUR框架通过操纵关键路由将安全输出转为有害输出,在越狱基准上取得超90%的成功率。
- 会议论文ICML 2026
诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击
提出基于分层遗传算法的黑盒攻击方法,通过扰动问题逻辑结构诱导推理模型生成极长冗余推理链,实现DoS资源耗尽攻击。
- 会议论文ICML 2026
协作式 MARL 的预算高效攻击与鲁棒性训练
提出 BHEA 分层攻击,分离劫持时机与目标智能体的选择及动作替换;在 SMAC 上同等预算下攻击更强,针对它训练可提升鲁棒性。
- 会议论文ICML 2026
哈密顿生成框架下的结构化多步越狱
提出结构化越狱攻击SJA,通过双曲空间哈密顿动力学将有害问题分解为无害子问题序列并融合隐蔽叙事,有效绕过安全对齐并重构有害答案。
- 会议论文ICML 2026
视觉 token 压缩下大型视觉语言模型的对抗鲁棒性
指出现有编码器攻击因优化与推理不匹配而低估压缩后 LVLM 的脆弱性,提出 CAGE 使扰动优化与压缩推理对齐,在多种压缩机制下鲁棒准确率更低。
- 会议论文ICML 2026
MADA-Attack:针对视觉语言模型的可迁移多模态注意力分散对抗攻击
针对多模态大模型提出多模态注意力分散对抗攻击框架,通过操纵语义标记与联合优化嵌入损失,实现高迁移性的通用对抗扰动。
- 会议论文ICML 2026
基于组合技能的 LLM 攻击博弈论分析
形式化攻击者借组合技能隐藏意图与防御者的博弈,刻画均衡并指出攻击方固有优势,推导最优防御,实证攻击强于现有方法。
- 会议论文ICML 2026
Furina:基于分片不确定性驱动的拒答不稳定性越狱攻击
揭示大模型安全拒答存在不稳定性区间,提出无需针对模型优化的越狱攻击Furina,通过分片提示放大不确定性并降低内部安全激活,在HarmBench等基准上超越现有基线。
- 会议论文ICML 2026
剖析安全回路:面向VLM可迁移对抗攻击的神经元干预
揭示VLM安全表征集中于特定中间神经回路,提出安全回路干预攻击(SCIA)通过抑制防御回路并放大可迁移回路,显著提升对黑盒VLM的越狱攻击效果。
- 会议论文ICML 2026
VERA-V:基于变分推断的视觉语言模型越狱框架
把多模态越狱发现建模为图文提示的联合后验学习,训练轻量攻击器采样;在 HarmBench 和 HADES 上优于基线,GPT-4o 上 ASR 最高提升 53.75%。
- 会议论文ICML 2026
当提示变为视觉:针对大型图像编辑模型的视觉中心越狱攻击
提出首个纯视觉输入的图像编辑越狱攻击VJA及基准IESBench,揭示主流商业模型高达80.9%的被越狱风险,并提出了基于反思多模态推理的免训练防御。
- 会议论文ICML 2026
沿结构传播扰动:面向异构表格数据的似然约束对抗攻击
提出白盒攻击 LCSA,用神经结构因果模型推断特征依赖并沿下游传播扰动,在 50 种配置中 45 种优于基线,对抗样本结构一致性与迁移性更好。
- 会议论文ICML 2026
TRAP:利用对抗补丁劫持VLA思维链推理
揭示思维链为VLA具身模型引入行为劫持风险,提出首个针对CoT推理的物理对抗补丁攻击TRAP,可在现实中诱导机器人执行对抗指定行为。
- 会议论文NDSS 2026
从因果视角增强越狱攻击与防御
提出 Causal Analyst,用因果发现找出提示特征中导致越狱的直接原因,并据此提升攻击成功率、改进护栏对混淆恶意意图的识别。