全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 会议论文ICML 2026
用自适应 SVD 结构化对抗对齐攻击灰盒大型视觉语言模型
仅访问视觉编码器的灰盒设定下,扰动视觉特征使其匹配攻击者指定的目标文本,并在多种 LVLM 上展现出良好的迁移性。
- 会议论文ICML 2026
Trojan-Speak:通过对抗性微调零越狱代价绕过宪法分类器
提出对抗微调方法Trojan-Speak,通过课程学习与GRPO训练通信协议绕过Anthropic宪法分类器,在几乎不降低推理能力的同时诱导CBRN危险信息。
- 会议论文ICML 2026
线性集成可抹除水印:LLM 分布扰动水印的脆弱性
提出 WASH,平均多个模型的输出分布即可抵消各自水印扰动;3 个模型使检测 z 分数降到 2 以下,TPR@5%FPR 降到 50% 以下。
- 会议论文ICML 2026
TSFAdv:面向时间序列预测的频域引导黑盒对抗攻击
提出结合频域先验与自然进化策略的黑盒对抗攻击框架TSFAdv,在低查询预算下有效诱发时序预测的轨迹偏差。
- 会议论文ICML 2026
推理作为攻击面:针对大语言模型的自适应进化思维链越狱
针对大型推理模型显式思维链带来的越狱风险,提出AE-CoT框架,通过角色扮演改写、语义片段分解与演化交叉变异搜索,生成高杀伤力且自适应的思维链越狱提示。
- 会议论文ICML 2026
多轮语言模型交互中状态依赖的安全失效
提出状态导向诊断框架STAR,从状态空间视角揭示静态评测下表现鲁棒的前沿模型在多轮交互中会因拒答表征单调漂移而发生快速安全崩溃。
- 会议论文ICML 2026
稀疏Token足矣:基于Token感知梯度优化的音频语言模型越狱
发现音频语言模型中梯度能量高度集中于少数音频Token,提出稀疏梯度优化方法TAGO,在大幅稀疏化下仍能对主流模型维持高越狱成功率。
- 会议论文ICML 2026
基于决策的对抗攻击中零阶法向量估计的偏差分析
揭示了基于决策的图像攻击中零阶法向量估计的敏感度不均问题,提出感知敏感度的重缩放算法SAR,降低扰动范数并提高攻击成功率。
- 会议论文ICML 2026
从相似性到脆弱性:针对大模型语义缓存的键碰撞攻击
揭示大模型语义缓存中局部性与抗碰撞性的本质冲突,提出黑盒碰撞攻击框架CacheAttack,能以高命中率劫持模型回答并诱发恶意行为。
- 会议论文ICML 2026
Jailbreak Foundry:从论文到可运行攻击的可复现基准
多智能体流程把越狱论文转成统一框架内的可执行模块,复现 30 种攻击,ASR 平均偏差仅 +0.26 个百分点,并在 10 个模型上统一评测。
- 会议论文ICML 2026
低秩与稀疏即所需:探索鲁棒分层潜在子空间用于可迁移对抗攻击
提出 LRS-Attack,对潜在特征做低秩加稀疏分解并引入分层专家混合,在 ImageNet 上提升跨 CNN/ViT 与防御设置的黑盒迁移性。
- 会议论文ICML 2026
DART:针对闭源多模态大模型对抗攻击的分布感知自适应关系迁移
提出对抗攻击方法DART,从统计视角利用能量距离对齐图像内在语义分布,并利用GNN自适应选择代理模型,显著增强了对抗样本在闭源多模态大模型间的迁移效果。
- 会议论文ICML 2026
释放傅里叶形状表征能力以攻击红外目标检测
针对红外目标检测提出可学习傅里叶形状对抗攻击方法,通过绕数定理将边界映射为掩码进行梯度优化,实现了高攻击成功率且物理鲁棒的行人规避检测攻击。
- 会议论文ICML 2026
语义路由器:利用单一对抗扰动劫持多模态大模型的可行性
提出语义感知通用扰动SAUP与SORT优化策略,能主动感知输入语义并将多模态大模型的多种决策劫持至攻击者指定目标,在Qwen上取得高攻击成功率。
- 会议论文ICML 2026
SpatialJB:文本空间分布艺术成为 LLM 护栏的“越狱钥匙”
利用空间结构化扰动让有害输出绕过输出护栏,攻击成功率近 100%,对 OpenAI Moderation API 也超 75%,并给出基线防御。
- 会议论文ICML 2026
声学干扰:利用声学潜在语义对大型音频语言模型的通用越狱
提出 AIA,用内容良性但带特定声学潜在语义的通用干扰音频破坏安全对齐,在 10 个 LALM 上攻击成功率达 SOTA。
- 会议论文ICML 2026
特洛伊知识:通过无害提示编织与自适应树搜索绕过商用LLM护栏
提出相关知识攻击智能体CKA-Agent,通过发出良性子查询并聚合多路径信息实现越狱,对主流商用模型取得超95%的越狱成功率。
- 会议论文ICML 2026
自适应探针式 Steering 实现鲁棒 LLM 越狱
利用模型提取思想引导 steering 向量逼近理想方向,并按对比激活统计自适应调节强度,将强化防护 LLM 的平均有害性得分从 6% 提升到 70%。
- 会议论文ICML 2026
多模态大模型的语音-音频组合攻击与SALMONN-Guard防御
提出黑盒评估基准SACRED-Bench,揭示复杂语音音频组合可有效绕过多模态大模型安全护栏,并构建多模态安全防护模型降低攻击成功率。
- 会议论文ICML 2026
攻破CLIP测试时防御的关键假设:基于分布差异操控的自适应攻击
揭示了现有CLIP测试时防御依赖于区分干净与对抗样本分布假设的根本缺陷,提出自适应攻击CLIP-MAD,显著降低了多项先进防御的鲁棒性。
- 会议论文ICML 2026
多样性越低越不安全:大语言模型测试时扩展的隐性普遍风险
揭示了测试时扩展中候选多样性降低会显著诱发不安全输出的缺陷,提出诊断性攻击协议RefDiv,发现该风险可迁移至主流闭源模型且现有护栏分类器难以防御。
- 会议论文ICML 2026
刻画非理性智能体:序列越狱中 LLM 行为的认知建模
用 C-IGT 任务与 GRW 架构分解 LLM 在多轮越狱中的决策机制,发现脆弱性源于乐观偏置学习、奖励放大和选择惯性,反事实反馈等会加速由拒答转向顺从。
- 会议论文ICML 2026
MoCo-EA:利用对抗模态连通性实现高效进化攻击
提出基于模态连通性的进化对抗攻击算法MoCo-EA,利用贝塞尔交叉算子在连续路径上优化扰动,显著提升黑盒对抗攻击的效率与迁移性。
- 会议论文ICML 2026
基于隐式神经表示的分类器的对抗鲁棒性研究
首次系统研究隐式神经表示(INR)分类器的对抗鲁棒性,通过替代模型实现实用的对抗攻击,发现对抗扰动使模型准确率骤降至接近归零且现有防御难以防护。