攻击arXiv 2610.08331
STCA:研究者提出针对自动驾驶视频 VLM 的时空一致性对抗攻击
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
- arXiv
- 2610.08331
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 无盒(离线迁移)
- 被测模型
- Video-LLaVA-7B、Qwen2.5-VL-7B、Dolphins
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
提出 LiBRA,在潜空间双向优化以规避图像水印双侧检测
摘要LiBRA 用双向潜空间优化规避双侧水印检测,并提高相对反转基线的保真。
提出 Bi-QSTO,优化能穿过质量筛选并在微调中削弱安全对齐的投毒样本
Bi-QSTO 研究一个实际训练缺口:基于质量的数据选择会先于微调决定样本去留,而以往微调投毒多假设毒样本直接进入训练集。已对齐 LLM 的拒答会被少量有害或看似无害的微调样本削弱。作者用三个问题串起实验:选择能否排除毒样本。
提出只训练或篡改多智能体潜在通信链路来提高有害遵从
学习得到的潜在通信链路会改变由冻结、对齐智能体组成的系统是否遵从有害请求。。作者研究三种拓扑:双智能体、三级顺序协作,以及双专家加汇总。
用通用扰动对恶意软件分类器及漂移检测器做规避与后门投毒
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。
提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略
只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。
提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击
FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。
提出 AdvOF,生成对抗物体误导视觉语言导航智能体的场景感知
AdvOF 是针对 VLM 驱动 VLN 服务导航的对抗物体攻击。