STCA:研究者提出针对自动驾驶视频 VLM 的时空一致性对抗攻击
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
- arXiv
- 2610.08331
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 无盒(离线迁移)
- 被测模型
- Video-LLaVA-7B、Qwen2.5-VL-7B、Dolphins
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出推理通道预填与输出前缀组合攻击以越狱推理模型
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
检验结构越狱 IICL 能否跨厂商泛化并与语言约束叠加
提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化
BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。
提出 DIVA,利用跨步条件传播对离散扩散视觉语言模型实施视觉越狱
提出 SN-Guided Diffusion,利用安全神经元实现离线越狱
论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒
提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景
摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。
提出 SMT 框架,用模拟审核轨迹越狱函数调用 LLM
提出 SlotGCG,按注意力选槽插入对抗 token 以越狱指令模型
提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击
FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。
提出 CodecAttack,在编解码器隐空间构造可穿透有损压缩的对抗音频
提出 Misrouter,借 MoE 路由优化仅输入前缀并迁移攻击
提出 PEO,直接优化原提示词嵌入实现白盒越狱
PEO是一种不追加对抗 token 的 white-box 越狱:直接改已有提示词嵌入,并只对未成功样本更换续写目标再优化。
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核
摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。
提出提取对齐 LLM 内嵌安全分类器并攻击其代理的越狱方法
作者提出一种白盒越狱做法:抽出对齐 LLM 内部 safety classifier 的近似,再攻击该近似并迁回原模型。