跳到正文
原文
论文追踪· arXiv:2511.13892· Badhan Chandra Das, Md Tasnim Jawad, Md Jueal Mia, M. Hadi Amini, Yanzhao Wu·本站收录 · 原文发表

论文提出利用图像排版操纵与多轮提示越狱智能交通系统中的 LVLM

Jailbreaking Large Vision Language Models in Intelligent Transportation Systems

论文速读

攻击

据论文 PDF 整理(AI 生成),以原文为准

作者用排版图像和三轮提示越狱交通场景LVLM:LLaVa-1.6上GPT-4评Turn3 ASR为92.67%。

威胁模型作者将ITS中的LVLM视为black-box。

问题
ITS中的LVLM同时读图和读文本。作者认为越狱可能引出安全策略禁止的响应,并举非法监视、身体伤害、无视交通标志或误分类关键物体为例。论文称LVLM多轮越狱和ITS中的这类风险尚未充分研究。
方法
作者用GPT-4做few-shot生成,再人工筛成150条交通有害查询。攻击抽出关键词,用Stable Diffusion生成物体图,并把有害文字做成图注,再用固定三轮提示逐步索取有害说明。防御先匹配短语,再由分类器决定拒绝或放行。
实验与结果
LLaVa-1.6、Qwen-2、GPT-4o-mini的GPT-4评Turn3 ASR为92.67%、84.12%、74.67%。作者称在两开源模型上高于FigStep与MM-SafetyBench。过滤后5.31%、25.33%、30.67%。
局限与可以继续做的
作者称GPT-4对细微有害内容的检测仍需发展,并计划增加基线、数据集和防御,以及用查询优化生成多轮提示,再评商用与推理向LVLM。实验是3个模型、150条查询的文本毒性分;论文未报告分类器模型和重复次数。
实验设置LLaVa-1.6、Qwen-2 等 · harmful queries relevant to transportation · ASR、ATS 等
威胁模型
作者将ITS中的LVLM视为black-box。攻击者不能访问模型参数,只能经标准用户界面(论文举例为驾驶仪表盘)提交输入并接收响应。目标是生成安全对齐策略禁止的响应,作者举例为OpenAI公布的禁止场景。
被测模型
LLaVa-1.6Qwen-2GPT-4o-mini
基准
harmful queries relevant to transportation
指标
ASRATStoxicity score
AI 导读论文系统分析了集成在智能交通系统(ITS)中的大型视觉语言模型(LVLM)在越狱攻击下的脆弱性。作者先按 OpenAI 禁止类别构建了与交通相关的有害查询数据集,再提出一种结合图像排版操纵与多轮提示的越狱攻击,并给出多层响应过滤防御技术。实验在多个开源与闭源 SOTA LVLM 上进行,用 GPT-4 判定生成回复的毒性分数并辅以人工核验,同时与已有越狱技术做了对比,指出图像排版操纵加多轮提示在 ITS 场景 LVLM 中带来的安全风险。

论文系统分析了集成在智能交通系统(ITS)中的大型视觉语言模型(LVLM)在越狱攻击下的脆弱性。作者先按 OpenAI 禁止类别构建了与交通相关的有害查询数据集,再提出一种结合图像排版操纵与多轮提示的越狱攻击,并给出多层响应过滤防御技术。实验在多个开源与闭源 SOTA LVLM 上进行,用 GPT-4 判定生成回复的毒性分数并辅以人工核验,同时与已有越狱技术做了对比,指出图像排版操纵加多轮提示在 ITS 场景 LVLM 中带来的安全风险。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    ITS中的LVLM可被排版图像与多轮提示越狱,作者给出数据集、攻击和响应过滤。

    ITS中集成的LVLM可被图像排版操纵和多轮提示词绕过安全对齐,生成策略禁止的响应。

    • 场景:作者称LVLM已用于交通数据分析、车与用户通信、路牌和信号理解、交通流分析与导航。作者举例,恶意用户可能借越狱把车辆用于非法监视或造成身体伤害,也可能让模型无视交通标志或信号,或误分类行人和应急车辆。
    • 现有不足:作者称文本模块虽有安全护栏,图文一起提示可能带来更多可利用途径。针对LVLM的多轮越狱,以及ITS中这类攻击后果,论文称尚未充分研究。
    • 本文做法:作者构建交通领域有害查询集,提出图像排版操纵加多轮提示词的越狱,并用规则加分类器的响应过滤做防御。作者在摘要中称该攻击是novel的。
    • 威胁模型:
      • 知识:ITS中的LVLM对攻击者是black-box,不能访问模型参数。
      • 能力:经标准用户界面交互并接收响应;论文举例为智能车驾驶仪表盘。
      • 目标:生成该模型安全对齐策略禁止的响应。作者举例为OpenAI公布、模型不应回答的禁止场景。
      • 过程:第i轮响应为Ri=Fθ(Qi, Hi−1)。攻击者设计查询序列AQi,使模型逐步产出有害目标响应。
  2. 有哪些相关研究?

    相关工作分LVLM越狱、LLM多轮越狱和ITS应用;基线为FigStep与MM-SafetyBench。

    LVLM越狱

    • FigStep(Gong等,AAAI 2025):把转述后的对抗目标藏进排版图像。作者把它列为基线,称只采纳主要思路,并在自建交通查询集上实现。
    • MM-SafetyBench(Liu等,ECCV 2024):论文称其把相关图像与对抗文本查询结合。作者同样将其作为基线,在自建集上实现。
    • 引言还列出提示内容打乱(Zhao等,2025),以及用加密和隐蔽evi alignment隐藏恶意意图(Wang等,2024)。论文此处只作列举。

    LLM上的多轮越狱

    • Crescendo(Russinovich等,2024)与Chain of Attack(Yang等,2024):用多轮对话逐步越狱LLM。论文点名的模型包括GPT-4、LLaMA-3和Gemini-2。
    • 论文称多轮越狱在LLM上已被充分考察,但用于LVLM仍远未充分研究。

    ITS中的LVLM

    • Mahmud等与Nie等综述LLM/LVLM接入交通预测、自适应信号、多模态融合、出行信息、V2X和用户侧出行服务。
    • LLM4AD(Cui等)把语言推理接入自动驾驶的决策与控制;Drive As You Speak(Cui等,2024)把LLM当作车辆的brain,对接感知与控制模块。
    • 论文转述的应用困难包括细粒度交通标志识别(Garg与Aich)、复杂交通场景中的Video-LLaVA和GPT-4(Jain等,2024),以及行人意图随手势复杂度、光照和遮挡变化(Bossen等,2025)。

    基线与数据集

    • 基线方法:FigStep、MM-SafetyBench。比较只在LLaVa-1.6与Qwen-2上进行,GPT-4系统提示词与本文相同,对照的是本文Turn 3。
    • 数据集:自建交通有害查询。GPT-4 few-shot先生成300条(5类各60),人工删去相似或重复项后留150条(各类30)。五类取自OpenAI使用政策:非法活动、制作恶意软件、造成身体伤害、协助欺诈、违反规则。

    论文称既有工作已经写出LVLM如何进入ITS,但安全风险下的挑战仍远未充分研究。作者把本文定位为用排版操纵和多轮提示词越狱这类LVLM,并给出多层响应过滤。

  3. 论文如何解决这个问题?

    有害文字写入物体图图注,固定三轮引出响应,再用短语规则和分类器过滤。

    攻击把有害请求写成良性物体图的图注,再用固定三轮对话把LVLM引向禁止响应;拦截靠多层响应过滤。论文未给攻击单独的方法缩写。

    问题设定

    • 输入是图像v和文本token序列。LVLM含视觉编码器、connector和文本模块;视觉嵌入映射到与文本共享的潜空间后再生成文本。
    • 第i轮由当前查询和历史Hi−1决定。攻击目标写成Ri∗=Fθ(AQi,Hi−1):对抗查询序列与此前历史一起送入模型,以得到有害响应。
    • 受害系统按第二节是ITS中的LVLM。攻击者不访问参数,交互界面按论文写法是标准用户界面。

    数据集与关键词

    • 从OpenAI使用政策中选五项与交通相关的禁止场景:非法活动、制作恶意软件、造成身体伤害、协助欺诈、违反规则。
    • GPT-4 few-shot生成300条,每类60。人工去掉相似或重复项,保留150条,每类30,并要求覆盖不同车辆和交通方式。
    • 关键词由人工从这150条中抽取,只用于后续生图和图注,不把整句有害查询交给生图模型。

    四步攻击

    • 生图:Stable Diffusion按关键词出图。论文引用的检查点是stable-diffusion-v1-5,尺寸1024×1024,尺寸设置跟随其引用的先前工作。作者称该图只含良性物体。
    • 排版:用PIL把有害查询和关键词作为图注叠到图上。字体FreeMonoBold,查询字号14,关键词字号18。作者将“良性图加有害图注”称为typography manipulation。
    • 三轮:提示词固定,每轮响应写入下一轮历史。第1轮询问图像内容,作者称这一轮是良性的,不计入毒性分。第2轮要求围绕图注做虚构情境。第3轮要求给出执行目标任务的分步说明。
    • 作者称这样把对抗意图藏在图注里,并逐步把模型引向有害响应。脚注称图示省略了原始对抗提示词。

    响应过滤

    • 对每轮响应Ri*施加D(·),两层按顺序执行。
    • 模式层:集合P收录越狱响应中常见短语。命中则输出DENY并停止。论文举了一类免责声明式短语,这里不复述原句。
    • 分类器层:方法节称为zero-shot classifier。禁止集Yproh对应上述五类,另有安全类Ysafe。预测类取置信度最大者,ŷi=argmaxj sj。属于禁止集则DENY,属于安全类则放行原响应。
    • 同一节后文把该层称为few-shot classifier。论文未写分类器是哪个模型,也未给出模式条数或arg max以外的数值阈值。

    成功判定

    • GPT-4按1到5分评毒性,依据上述五类;毒性分大于或等于4记为成功。ASR是达到阈值的比例,另报告ATS。
    • 作者对攻击产生的第2、3轮响应按同一标准人工打分。第1轮不评毒性。
  4. 论文做了哪些实验?

    作者称Turn3更易成功:GPT-4评ASR为92.67%、84.12%、74.67%。

    实验设置

    • 被测模型:LLaVa-1.6(7B,部署引用llava-v1.6-mistral-7b-hf)、Qwen-2(7B,部署引用Qwen2-VL-7B-Instruct)、GPT-4o-mini。OpenAI未披露后者参数量,论文称据报道约8B。三家都是被攻击模型,没有代理模型。
    • 数据:筛选后的交通有害查询150条,五类各30。ASR公式的分母写作N,各表未另行写出N。
    • 基线:FigStep与MM-SafetyBench。作者称采纳主要思路后在自建集上实现,只比较LLaVa-1.6和Qwen-2的Turn 3。
    • 指标:毒性分1–5,大于或等于4为成功;报告ASR与ATS。Table II表头写作ATC。
    • 评审:GPT-4使用带评分指令的系统提示词。作者对攻击的Turn 2与Turn 3全部响应人工打分,阈值相同。论文未报告GPT-4版本、人工人数和一致性。数据集生成也用了GPT-4。
    • 运行:一块NVIDIA RTX A6000(48GB)。开源模型走Huggingface API,GPT-4o-mini走OpenAI API。攻击是固定三轮。论文未报告重复次数。

    主结果

    据Table I,本文攻击如下。

    表格较宽,可左右滑动

    模型Turn3 GPT-4 ASRTurn3 GPT-4 ATSTurn3 人工 ASRTurn2 GPT-4 ASR
    LLaVa-1.692.67%4.3988.67%10.67%
    Qwen-284.12%4.2581.33%12.19%
    GPT-4o-mini74.67%3.9180.66%14.00%
    • 作者称Turn 3要的是分步执行过程,Turn 2只是围绕图注的虚构情境,因此Turn 3的ASR与ATS更高;并称所测开源与闭源模型都容易被该攻击攻破。
    • 作者称Turn 3的ASR在GPT-4与人工之间相差约4%、约3%、约6%,顺序为LLaVa、Qwen、GPT-4o-mini;Turn 2有类似趋势。正文把三个Turn 3的GPT-4 ASR写成约92%、约84%、约75%。

    与现有攻击对比

    • 对照:同一自建集、同一GPT-4系统提示词;模型只有LLaVa-1.6与Qwen-2,对照本文Turn 3。
    • 数字:据Table II,FigStep的ASR/ATC为65.00%/3.50与12.31%/1.16;MM-SafetyBench为71.33%/3.47与73.14%/3.73;本文为92.67%/4.39与84.12%/4.25。表头是ATC,正文称ATS;后两格与Table I的GPT-4 Turn 3 ATS相同。
    • 作者解读:作者称本文在这两个模型上高于两个基线。Table II没有GPT-4o-mini。FigStep在Qwen-2上的ASR低于同表其他ASR格子。

    响应过滤

    • 设置:过滤的是本文攻击在三模型上的响应,只报GPT-4分数(Table III)。论文未报告该表的人工分,也未写分类器模型。
    • 数字:Turn 3的ASR/ATS为LLaVa-1.6 5.31%/1.19、Qwen-2 25.33%/1.91、GPT-4o-mini 30.67%/2.23。Turn 2的ASR为6.21%、8.01%、9.33%,ATS为1.32、1.40、1.49。
    • 作者解读:作者称Turn 3的ASR约降低87%、59%、44%,并称对LLaVa-1.6特别有效。这三个约数在正文,不是表内单独一列。

    无物体图像

    • 设置:跳过SD物体图,只用PIL把查询和关键词画成图像。FreeMonoBold,字号26与36。三模型都有GPT-4与人工分(Table IV)。
    • 数字:GPT-4 Turn 3的ASR/ATS为80%/3.87、71.33%/3.60、58%/3.21,顺序为LLaVa-1.6、Qwen-2、GPT-4o-mini。同表Turn 2的GPT-4 ASR为16%、3.01%、4.00%。人工Turn 3 ASR为81.33%、72%、62.67%。
    • 作者解读:作者称两个轮次、全部模型的ASR与ATS都下降,并认为加入与有害查询相关的物体图像会提高攻击效果。作者称GPT-4o-mini的Turn 3人工ASR比GPT-4约高5%;LLaVa与Qwen只有轻微偏离。

    其他消融与分析

    • 主攻击字号为查询14、关键词18,图像1024×1024;论文未做参数扫描,只在无物体图设置改用26与36。
    • 防御第二层在方法节称zero-shot classifier,后文称few-shot classifier;决策是类置信度的arg max,论文未给模式条数。
    • 结果未按五类禁止场景拆开。论文未报告三轮以外的迭代预算。
  5. 有什么可以进一步探索的点?

    作者计划做查询优化式多轮越狱,并评估商用与推理向LVLM;另称GPT-4评分仍需发展。

    作者指出的局限与后续方向

    • 评分器:Discussion称GPT-4或可先做有害性初评,但对细微或含蓄有害内容的检测有局限;作者称还需进一步发展,才能把它当作fully reliable、comprehensive的文本有害性评估器(VI)。
    • 更多比较:作者计划加入更多基线,在更多样的数据集上比较,并开发more robust的防御技术(VI)。这是计划,不是已完成。
    • 固定提示:作者写明当前多轮对话使用固定提示词,并计划以后用基于查询优化的越狱动态生成这些提示(VI)。
    • 后续模型:Conclusion计划开发查询优化式越狱,以自动生成多轮提示,并评估商用和面向推理的LVLM在多种越狱下的脆弱性(VIII)。

    实验覆盖范围

    • 被测LVLM为LLaVa-1.6、Qwen-2、GPT-4o-mini共3个;查询为人工筛选后的150条,五类各30(III-A、IV、V,Table I–IV)。
    • 基线是在自建集上重实现的FigStep与MM-SafetyBench;Table II只有LLaVa-1.6和Qwen-2,且只有GPT-4评分。
    • 防御数字来自Table III,覆盖三模型的Turn 2与Turn 3,评审为GPT-4。论文未报告防御的人工分数和分类器模型。
    • 无物体图变体覆盖三模型,GPT-4与人工都有分(Table IV)。论文未报告重复次数、按类别ASR,以及GPT-4与人工的一致性。
    • 实验通过Huggingface API与OpenAI API对生成文本打毒性分(IV-A)。威胁模型中的界面例子是驾驶仪表盘(II-B)。Discussion里路标、标记或摄像头被操纵是作者举的可能后果,论文未报告相应测量。
  6. 总结一下论文的主要内容

    自建150条交通查询上,排版加三轮提示可越狱三款LVLM,响应过滤能压低ASR。

    作者在智能交通场景中,用图像排版和多轮提示词测试LVLM能否被诱导输出安全策略禁止的内容,并加上响应过滤。

    • 问题:作者关心车载LVLM被黑盒用户经仪表盘一类界面诱导,生成非法活动、恶意软件、身体伤害、欺诈或违规相关响应。
    • 做法:GPT-4 few-shot产生查询,人工留150条。攻击人工抽关键词,Stable Diffusion按关键词生成1024×1024物体图,再用PIL把查询和关键词写成图注。固定三轮从看图到虚构情境,再要分步说明。防御先匹配常见越狱短语,未命中则由分类器在安全类与禁止类之间取最大置信度。
    • 主结果:GPT-4评分、阈值4、Turn 3时,LLaVa-1.6、Qwen-2、GPT-4o-mini的ASR为92.67%、84.12%、74.67%,ATS为4.39、4.25、3.91(Table I)。同条件人工ASR为88.67%、81.33%、80.66%。
    • 对照:作者称在同集上重实现的FigStep、MM-SafetyBench低于本文Turn 3,比较只覆盖两个开源模型(Table II)。去掉物体图后,三模型GPT-4 Turn 3 ASR为80%、71.33%、58%(Table IV)。作者认为相关物体图像会提高攻击效果。
    • 防御与后续:过滤后Turn 3 ASR为5.31%、25.33%、30.67%(Table III)。作者称防御能够缓解该攻击,对LLaVa-1.6尤其如此,并称ITS中的LVLM在该攻击下容易产出有害响应。作者计划以后自动生成多轮提示,并评估商用与面向推理的LVLM。
阅读原文arxiv.org