STCA:研究者提出针对自动驾驶视频 VLM 的时空一致性对抗攻击
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
- arXiv
- 2610.08331
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 无盒(离线迁移)
- 被测模型
- Video-LLaVA-7B、Qwen2.5-VL-7B、Dolphins
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控
摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器
摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。
提出 SinoGlyphBench,用配对字形混淆诊断中文审核稳定性
SinoGlyphBench是一个配对诊断基准,用来看内容审核在可还原的中文字形混淆下是否还保持原决定。
利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链
摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。
提出最小范数攻击集成,用鲁棒性曲线评测图像分类器
这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。
提出 HPAA 攻击,用排版视觉线索绕过内容审核系统
这篇论文研究了人类视觉感知与大模型分词处理机制之间的差异所导致的内容审核漏洞。
提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本
提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击
FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。
提出 Vaporizer,用词法变换、翻译和释义破解 LLM 输出水印
提出字符级扰动与遗传算法去除 LLM 水印
这篇工作评估推理时 LLM 水印在黑盒、有限查询下的移除难度,并比较字符级、token 级和句子级编辑。
提出 AdvOF,生成对抗物体误导视觉语言导航智能体的场景感知
AdvOF 是针对 VLM 驱动 VLN 服务导航的对抗物体攻击。