全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
攻破CLIP测试时防御的关键假设:基于分布差异操控的自适应攻击
揭示了现有CLIP测试时防御依赖于区分干净与对抗样本分布假设的根本缺陷,提出自适应攻击CLIP-MAD,显著降低了多项先进防御的鲁棒性。
- 会议论文ICML 2026
多步LLM智能体攻击的因果检测
提出CausalTrace框架,将多步提示注入防御重构为因果推断问题,通过构建结构因果模型并应用do演算,有效区分恶意注入与良性工作流。
- 会议论文ICML 2026
多样性越低越不安全:大语言模型测试时扩展的隐性普遍风险
揭示了测试时扩展中候选多样性降低会显著诱发不安全输出的缺陷,提出诊断性攻击协议RefDiv,发现该风险可迁移至主流闭源模型且现有护栏分类器难以防御。
- 会议论文ICML 2026
刻画非理性智能体:序列越狱中 LLM 行为的认知建模
用 C-IGT 任务与 GRW 架构分解 LLM 在多轮越狱中的决策机制,发现脆弱性源于乐观偏置学习、奖励放大和选择惯性,反事实反馈等会加速由拒答转向顺从。
- 会议论文ICML 2026
MoCo-EA:利用对抗模态连通性实现高效进化攻击
提出基于模态连通性的进化对抗攻击算法MoCo-EA,利用贝塞尔交叉算子在连续路径上优化扰动,显著提升黑盒对抗攻击的效率与迁移性。
- 会议论文ICML 2026
TRAP!面向Web智能体的任务重定向说服评测基准
构建基准TRAP以评估网页界面隐蔽对抗指令对Web智能体的提示注入攻击,发现六款前沿模型平均在25%的任务中易受攻击,揭示了智能体的系统性漏洞。
- 会议论文ICML 2026
基于隐式神经表示的分类器的对抗鲁棒性研究
首次系统研究隐式神经表示(INR)分类器的对抗鲁棒性,通过替代模型实现实用的对抗攻击,发现对抗扰动使模型准确率骤降至接近归零且现有防御难以防护。
- 会议论文ICML 2026
定位与消除:基于梯度引导Token抑制抵御视觉提示注入攻击
提出GTM防御方法,通过隐状态梯度范数定位视觉提示注入的关键图像Token并进行掩码抑制,在极低计算开销下将攻击成功率降至接近归零。
- 会议论文ICML 2026
贪心坐标扩散:基于扩散引导的高效且语义连贯对抗攻击
提出贪心坐标扩散攻击框架GCD,利用离散扩散模型的先验引导搜索语义连贯且低困惑度的对抗后缀,在灰盒设置下实现更高越狱攻击成功率并绕过护栏检测。
- 会议论文ICML 2026
OBJVanish:提示驱动生成物理可实现的3D激光雷达隐身物体
提出文本到3D对抗生成框架OBJVanish,通过迭代优化提示词生成物理可实现物体,使六种SOTA激光雷达检测器完全漏检。
- 会议论文ICML 2026
OrchJail:以编排引导的 fuzzing 越狱调用工具的文生图 Agent
指出工具编排是文生图 Agent 的新攻击面,利用成功越狱的工具调用轨迹引导 fuzzing,攻击成功率更高、查询成本更低,并能抵御常见越狱防御。
- 会议论文ICML 2026
Metis:通过自进化元认知策略优化学习越狱 LLM
将越狱建模为对抗性 POMDP 中的推理时策略优化,在 10 个模型上平均 ASR 达 89.2%,token 成本平均降低 8.2 倍。
- 会议论文ICML 2026
MultiBreak:用于评估大模型安全性的多轮越狱评测基准
提出包含超万条多轮对抗提示的越狱基准MultiBreak,通过主动学习扩增高质量攻击样本,揭示了单轮看似无害的意图在多轮对话中更易绕过安全对齐。
- 会议论文ICML 2026
充耳不闻?注意力感知的隐蔽黑盒对抗性音频攻击
提出音乐载体选择算法与注意力感知隐蔽性损失,生成能够欺骗主流语音助手识别攻击指令的黑盒物理对抗音频,显著提升攻击有效性与隐蔽性。
- 会议论文ICML 2026
DDGA:面向视觉语言模型可迁移对抗攻击的 Dirichlet 分布梯度聚合
用可学习 Dirichlet 策略优化对抗演化三角形单纯形上的扰动分布,在图文检索与图像描述上超越现有迁移攻击。
- 会议论文ICML 2026
ImpText:隐式文本推理基准与工具增强框架
针对通过形变、伪装等方式隐藏恶意文字以绕过内容审核的场景,提出 ImpText-Bench,最强闭源模型仅得 35.79%,并提出工具增强的 ImpText-Reader。
- 会议论文ICML 2026
新型“广撒网”越狱攻击威胁大模型安全
提出一种针对多个大模型同时查询以诱导有害输出的“广撒网”越狱场景与定制攻击方法,在无额外防护时攻击成功率可达100%。
- 会议论文ICML 2026
“有人藏了它!”:针对 LLM 检索的查询无关黑盒攻击
用零样本代理 LLM 生成可迁移的注入 token,无需受害查询或模型知识即可操纵 LLM 检索结果,在多个检索器上有效。
- 会议论文ICML 2026
CausalArmor:基于因果归因的高效间接提示注入护栏
针对智能体易受间接提示注入且现有防御开销大的问题,提出CausalArmor框架,基于因果消融检测不可信内容主导偏移并按需触发净化与思维链掩码。
- 会议论文ICML 2026
稀疏模型与稀疏安全:混合专家大语言模型中的不安全路由
发现MoE大模型的安全能力具有稀疏性,提出F-SOUR框架通过操纵关键路由将安全输出转为有害输出,在越狱基准上取得超90%的成功率。
- 会议论文ICML 2026
RedVisor:基于零拷贝KV缓存复用的推理感知提示注入防御
提出RedVisor框架,利用轻量适配器在推理阶段检测注入并引导安全响应,结合零拷贝KV缓存复用消除冗余计算,兼顾检测精度与吞吐量。
- 会议论文ICML 2026
诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击
提出基于分层遗传算法的黑盒攻击方法,通过扰动问题逻辑结构诱导推理模型生成极长冗余推理链,实现DoS资源耗尽攻击。
- 会议论文ICML 2026
协作式 MARL 的预算高效攻击与鲁棒性训练
提出 BHEA 分层攻击,分离劫持时机与目标智能体的选择及动作替换;在 SMAC 上同等预算下攻击更强,针对它训练可提升鲁棒性。
- 会议论文ICML 2026
AI 审稿人看到全貌了吗?攻击与防御多模态同行评审
提出 PaperGuard 基准,含多模态评审数据集、针对文本与图表的攻击套件及基于分块嵌入检索的防御;实验表明 AI 审稿人普遍易受攻击。