跳到正文
原文
论文追踪· arXiv:2608.11816· Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian·本站收录 · 原文发表 精选关注度30

研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

作者对9款VLM进行敏感图像审计,发现中文提示下状态对齐框架率为15.98%(英文5.85%),代际间拒答减少而重构增加。

问题
现有多模态模型在面对政治敏感图像时,审查机制是否超越了传统可见的显式拒答,转而通过流畅的官方叙事重构来隐蔽过滤信息?这一机制的触发条件与代际演化特征尚未得到系统检验。
方法
构建包含200张十类政治敏感图像的基准与抽象探针,设计四种诱导范式和中英双语提示,在关闭思考模式下审计9款开源VLM,并通过双前沿LLM与人类专家进行六维度独立评估。
实验与结果
全量21,708次试验中中文提示的状态对齐重构率为15.98%(英文5.85%);文本命名诱导重构率达36.5%,高于图像条件;在Qwen四代演进中,显式拒答从9.0%降至4.6%,重构率从4.8%升至33.0%。
局限与可以继续做的
研究属于观察性审计,无法确立因果关系;Qwen代际间存在参数量与骨干网络架构混杂;评测仅覆盖开源VLM与公开归档静态图像,且在边缘案例上对重构的人类判定存在主观性。
实验设置Qwen2-VL-7B、Qwen2.5-VL-7B 等 · 200-entry core sensitive image benchmark、Visual-abstraction probe (7 variants) 等 · State-aligned framing rate (D4 SA%)、Explicit refusal rate (D1 refusal%) 等
模型
Qwen2-VL-7BQwen2.5-VL-7BQwen3-VL-8BQwen3.5-9BGLM-4.6V-FlashInternVL3-8BMiniCPM-V-2.6Pixtral-12BLlama-3.2-11B-Vision
基准
200-entry core sensitive image benchmarkVisual-abstraction probe (7 variants)Image-text paired probe (52 anchor entities)
指标
State-aligned framing rate (D4 SA%)Explicit refusal rate (D1 refusal%)Information-integrity failure rate (D2 integ-fail%)Visual grounding rate (D3)Language consistency (D5)Response length (D6)
AI 导读和推荐理由全文 336 字

研究者构建了覆盖十类政治敏感话题的 200 张图像基准,对 9 个视觉语言模型(7 个中国来源、2 个非中国来源)在四种提问范式和两种提示语言下运行 21708 次试验,由两个前沿 LLM 评审按六个维度逐条标注,并在 200 条样本上与三名人类专家验证。结果显示,中文提示下出现国家立场改写的几率约为英文提示的 3.67 倍,且在每个模型内部都成立;中国来源模型的改写率高于非中国模型,方向在两个评审和人类标注者间一致,幅度随评审不同在 1.6 至 3.2 倍之间。改写集中在文本提及敏感主体的条件下(36.5%),仅给图像时为 9.8%;在四代 Qwen 多模态模型上,显式拒答下降而国家立场改写上升,改写以替换和委婉语为主,且不含拒答关键词,关键词检测方法难以发现。

推荐理由对 9 个视觉语言模型 21708 次试验的审计显示,审查正从可见的拒答转向难以察觉的改写,为多模态安全评测提供了新的测量维度。

深度解读

6 个问题,约 6,800 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    论文研究视觉语言模型在敏感图像上是否超越显式拒答,转向以符合官方叙事的重构话语隐蔽传递审查内容。

    论文试图解决视觉语言模型(VLM)在处理政治敏感图像时,是否以及如何超越显式拒答、转向系统性采用符合政府官方叙事的话语重构(state-aligned framing)进行隐蔽审查的问题。

    • 多模态信息把关场景:多模态AI助手正成为公众解读历史与新闻照片的核心媒介,若模型在解释敏感图像时隐蔽过滤并重构叙事,用户难以察觉信息已被扣留。
    • 词表检测方法的结构性失效:作者称以往文本与多模态安全审计主要关注显式拒答(refusal),依赖关键词过滤;但重构话语表面流畅且切题,传统词表检测在结构上无法识别。
    • 审查形态的潜在演化假设:作者假设经过对齐训练的VLM携带潜在偏向,在特定触发条件下倾向于依从官方立场叙述,审查行为可能从可见的“拒绝回答”演变为不可见的“流畅重构”。
    • 多维度解耦评估方案:论文构建了包含200张敏感图像的双语基准与视觉抽象探针,提出解耦拒答与重构的六维度审计框架,系统测量9款开源VLM在多场景下的行为表现。
  2. 有哪些相关研究?

    论文梳理了文本模型审查与偏置、多模态安全性与先验偏差,以及大模型作为裁判等方向的研究脉络。

    论文梳理了以下三个维度的相关研究脉络:

    文本大模型政治偏置与状态审查

    • Pan 和 Xu(2026):对比了9款中国与非中国文本大模型在145个政治问题上的表现,提出反驳/回避/捏造分类法,将审查差异归因于监管要求;作者指出其主要关注文本,且发现语言效应远小于来源效应。
    • Ahmed 等(2025):利用简体中文与繁体中文的对比及分类器,检测到西方模型中同样存在审查偏置。
    • Naseh 等(R1dacted, 2025):将 DeepSeek-R1 的审查行为定位于模型权重而非仅限 API,并区分了模板式压制与显式拒答。

    多模态大语言模型安全与先验偏差

    • Liu 等(2024)与 Ying 等(SafeBench, 2026):调研了多模态越狱与风险场景,发现针对文本的防御可通过图像嵌入被绕过,跨模态训练会削弱基座模型的对齐。
    • Vo 等(2025)与 Patil 等(2025):Vo 等指出在中性提示下,VLM 倾向于依靠文本先验记忆而非眼前图像回答;Patil 等研究了多模态敏感知识的机器遗忘,指出敏感知识多定位于语言模型层而非跨模态投影层。
    • Li 等(2023)与 Birhane 等(2021):分别评估了多模态模型中的对象与属性级幻觉,以及网络图文预训练数据中固有的刻板印象。

    LLM-as-judge 与宣传评估方法

    • Zheng 等(2023)与 Liu 等(G-EVAL, 2023):确立了大模型作为裁判评估开放式生成的通用范式。
    • Taiwan AI Labs(2025)与 Ko(2026):前者提出细则指导的LLM裁判来评估宣传话语;后者构建台湾主权基准,提出考虑质量调整的一致性与官方术语红旗分类。
    • Zhang 等(ChineseSafe, 2024):构建包含20.5万条样本的中文安全基准,作者指出该基准将政治内容归入安全类别的立场与本文正交。

    基线方法与基准

    • 实验以7款中国开源 VLM(Qwen 系列四代、GLM-4.6V-Flash、InternVL3-8B、MiniCPM-V-2.6)和2款非中国开源 VLM(Pixtral-12B、Llama-3.2-11B-Vision)为评测对象,在自建的200张政治敏感图像基准、52个图文配对实体及7级视觉抽象探针上进行对比。

    定位与区别

    • 作者称,以往多模态安全基准均未将政治审查作为核心研究对象,亦未对比中外 VLM 在敏感图像上的系统性重构差异;本文将无法被关键词匹配识别的话语重构确立为首要测量信号。
  3. 论文如何解决这个问题?

    论文构建解耦拒答与重构的六维审计体系,结合敏感图像基准、图文对照与视觉抽象探针,经双前沿LLM与专家验证。

    论文的整体思路是将多模态政治审查解耦为六个独立维度,构建包含十类敏感主题的图文基准与多级视觉抽象探针,提出状态对齐框架(state-aligned framing)判定标准与三元话语修辞体系,由双独立前沿LLM裁判打分并经人类专家验证。

    问题形式化与统计建模

    • 将每个回复是否被判定为状态对齐(D4)建模为二元变量 Y ∈ {0, 1},采用带有图像实体聚类稳健标准误的逻辑回归: logit Pr(Y = 1 ∣ ℓ, o, t) = α + γ 1[ℓ=zh] + δ 1[o=cn] + τt 该公式用于联合估计提示语言 ℓ、模型来源 o 与诱导范式 t 对状态对齐发生几率的影响。
    • 在罕见结局假设下,作者推导了裁判检出率不完全时的几率比稳健性: OR̂ ≈ (sπ1)/(sπ2) = (π1)/(π2) ≈ ORtrue 该公式说明当裁判的灵敏度 s 未知但在不同组间保持相同时,灵敏度在分子分母中相互抵消,因而估计出的几率比近似无偏。

    评测数据集与探针设计

    • 核心敏感图像基准:收集来自维基媒体(约40%)、国际新闻及被删帖归档的200张图像,涵盖八大类(主权、民族、言论自由、领袖与政党符号、集体行动/抗议、民主运动、宗教、历史事件),分为155张高敏感图像与45张政治相关但官方允许的低敏感对照图像。
    • 图文配对探针:针对52个锚点实体设置两组条件,即提供图像的图片描述(comment-image)与不提供图像、仅提供实体名称的文本介绍(comment-text),用于分离视觉识别驱动与文本先验驱动的重构。
    • 视觉抽象探针:选取14张标志性图像生成7级视觉变换(原图A0、中心裁剪A1、灰度A2、边缘图A3、二值化A4、FFT低通A5、剪影A6),测试模型行为是依赖表面像素还是依赖标志性轮廓的语义识别。

    六维度评估细则与话语分类

    • 核心维度解耦:独立评测显式拒答(D1)、信息完整性(D2)、视觉依据(D3,文本试验为N/A)、状态对齐框架(D4)、语言一致性(D5)与回复字符长度(D6),确保拒答与重构各自独立度量。
    • 三元话语修辞分类(D4):细分为公开支持(DT1,使用官方口号或批判定性)、替代/委婉(DT2,将敏感对象替换为温和概念,如将拘留所称作职业培训中心)、转移视线(DT3,虚假平衡或对外归咎)。
    • 元判定规则:强调修辞精巧不能免责,即包含事实信息或看似中立平衡的回复,只要系统性植入了官方定性叙事,依然判定为D4;同时排除仅中立引用法律记录的客观回复。

    审计执行与质量控制

    • 推理参数控制:9款VLM均采用统一采样参数(温度0.7、top_p 0.8、top_k 20、max_tokens 1024),并在3个随机种子(42, 622, 997)下重复。
    • 推理模式与提示设计:对具备思考能力的 Qwen3.5-9B 与 GLM-4.6V-Flash 强制关闭 thinking 模式,验证输出中无思考标签;主评测采用中性表面描述指令(describe),避免诱导性词汇。
    • 双裁判与人类验证:由 Claude Opus 4.7 作为主裁判、GPT-5.5 作为全量复核裁判(两者均关闭深度思考),要求裁判输出必须包含原文逐字引文;并在200例分层样本上与3位独立人类专家进行盲审一致性校验。
  4. 论文做了哪些实验?

    实验完成21,708次试验,测得中文提示对齐几率比达3.67倍,Qwen代际演进中拒答下降而重构升至33.0%。

    实验设置

    • 被测模型:共9款开源VLM,包括7款中国模型(Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B、Qwen3.5-9B、GLM-4.6V-Flash、InternVL3-8B、MiniCPM-V-2.6)与2款非中国模型(Pixtral-12B、Llama-3.2-11B-Vision)。
    • 评测任务与规模:覆盖四种范式共21,708次试验,包括200张图像描述(describe,10,800次)、52个实体的图文配对(comment-image与comment-text各2,808次)、14张图像7级视觉抽象(abstraction,5,292次);敏感度分为155张高敏感和45张低敏感图像。
    • 语言与随机种子:全量试验均在简体中文与英文提示下以 1:1 分布展开(各10,854次),每个条件运行3个独立随机种子(42, 622, 997)。
    • 评审方式与基线:主评审采用 Claude Opus 4.7,全量复核采用 GPT-5.5;在200例分层样本上进行3位人类专家独立验证(Gwet's AC1:D1 0.97、D4 0.39;主评审与人类多数票全维度一致率为89.2%)。
    • 指标定义:主要包括显式拒答率(D1 refusal%)、信息完整性缺失率(D2 integ-fail%)、状态对齐框架发生率(D4 SA%)、视觉依据率(D3)、语言一致性(D5)及去除排版后的净回复字符长度(D6)。

    主结果

    表格较宽,可左右滑动

    子集条件试验次数 n状态对齐框架率 SA%显式拒答率 refusal%信息完整性缺失率 integ-fail%
    全体模型 · 中文提示10,85415.983.3885.7
    全体模型 · 英文提示10,8545.854.8783.6
    中国模型 · 中文提示8,44218.74.184.0
    中国模型 · 英文提示8,4427.15.282.8
    非中国模型 · 中文提示2,4126.41.092.0
    非中国模型 · 英文提示2,4121.63.686.5

    (据 Table 1,主裁判 Claude Opus 4.7 评测结果)

    • 语言门控效应:作者报告中文提示词下的状态对齐框架发生率约为英文提示词的近3倍(15.98% 对 5.85%),逻辑回归中中文提示的对齐几率比达 3.67 倍(95% CI [3.20, 4.20],p < 10^-78,据 Table A4)。
    • 来源效应与稳健性:中国模型整体对齐框架率为 12.89%,非中国模型为 3.98%(据 5.2 节);作者称来源效应方向在两款裁判和人类评分中均成立,但效应倍数受裁判影响在 1.6 至 3.2 倍之间变动,且模型级检验在多重比较校正后未达到统计显著水平。
    • 语言与来源相互独立:在加入语言与来源交互项的回归中,交互项不具有统计学显著性(OR 0.78,p = 0.230,据 Table A4),作者认为语言效应表现为各模型间近似恒定的叠加平移。

    代际演进:从显式拒答到隐蔽重构

    • 测了什么:在阿里巴巴 Qwen 多模态系列四代模型(Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B、Qwen3.5-9B)上追踪 D1(显式拒答)、D4(状态对齐框架)与 D6(有效回复长度)的纵向演变。
    • 实验结果:状态对齐框架率从 4.8%、7.2%、21.4% 严格单调上升至 33.0%;显式拒答率整体从 9.0% 降至 4.6%(四代分别为 9.0%、5.4%、2.0%、4.6%),在第二代发生二者交叉(据 Figure 7);剔除排版与脚手架后的中位回复字符数从 203 字符增至 806 字符(据 Table A17 深度清洗数据)。
    • 作者的解读:作者认为审查形式发生了代际迁移,模型并未减少审查,而是将用户可识别的可见拒答替换为难以察觉的流畅重构;回复篇幅扩张了约四倍,新增的文本表面恰好承载了替代性叙事与平衡修辞。

    任务范式与视觉抽象的调制效应

    • 测了什么:对比仅提供实体名称的文本任务(comment-text)与提供图像的任务(comment-image、describe),以及测试14张图像在7级视觉抽象变换下的表现。
    • 实验结果:文本任务的对齐框架率达 36.5%、拒答率达 25.0%,而相同实体的图像任务对齐率仅为 9.8%(据 Table 2);视觉抽象下对齐率从原图的 3.4% 降至边缘图的 1.5%,但剪影层仍达 2.4%(据 Table A8),其中1989年绝食图像剪影仍触发 16.7% 的重构(9/54次,据 Table A7)。
    • 作者的解读:重构主要受语言模型的文本先验而非视觉输入驱动;在高度抽象下,重构依赖于模型对标志性轮廓的语义识别而非像素细节,对照组剪影重构率为0%。

    敏感度选择性与修辞策略分析

    • 测了什么:将200张图像分为高敏感(155张)与低敏感对照(45张),检验模型来源差异;并分析对齐回复中的话语策略分布(DT1/DT2/DT3)。
    • 实验结果:高敏感图像上中国模型重构率为 18.38%,非中国模型为 5.92%(差距 +12.46 个百分点);低敏感图像上二者分别为 3.54% 与 0.37%(差距 +3.17 个百分点),双重差分为 +9.28 个百分点(据 Table A10)。对齐回复中 DT2(替代/委婉)占比为 75.4%,DT1(公开支持)为 51.8%,DT3(转移视线)为 14.8%(据 Table A6)。
    • 作者的解读:作者认为来源差距并非由通用的训练数据或基底能力差异导致,而是高度集中于官方叙事受争议的高敏感内容;重构以替代为主导且在中英文间修辞分布保持一致,传统词表方法会漏检 97.7% 的替代型重构。

    其他消融与分析

    • 开放式叙事提示词(narrative)相比描述性提示词(describe):全量试验对齐率在 Opus 4.7 下上升 2.6 个百分点(8.8% 至 11.4%),在 GPT-5.5 下上升 5.4 个百分点(11.5% 至 16.9%,据 Table A9)。
    • 信息完整性失败类型:状态对齐回复中有 57.0% 涉及事实捏造或重命名,而非对齐回复中仅占 12.9%,后者主要表现为完全遗漏(53.9%,据 Table A6)。
    • 视觉依据与重构关系:在配对图像任务中,具备视觉依据的回复重构率为 7.1%,无依据者为 14.2%(据 Table A13)。
    • 种子间波动性:72个单元格中跨种子对齐率标准差中位数为 1.21 个百分点,仅 GLM-4.6V-Flash 超过 2.5 个百分点(据 Table A11)。

    负面结果与例外

    • 在代际趋势中,Qwen3.5-9B 的显式拒答率出现反弹(从 Qwen3-VL-8B 的 2.0% 回升至 4.6%),作者解释这与模型架构向统一多模态骨干转变相吻合;此外四代模型的等级趋势检验未达统计显著(p = 0.083),作者将其定性为描述性形态转变而非显著趋势。
  5. 有什么可以进一步探索的点?

    作者指出了研究的观察性性质与架构混杂局限;实验覆盖范围受限于开源检查点、中性提示与非思考模式。

    作者指出的局限与后续方向

    • 研究设计的观察性限制:作者指出研究属于观察性与横截面性质,无法确立监管要求与所观测模式之间的因果关系(出自第6节 Limitations)。
    • 代际模型间的混杂因素:作者指出四代 Qwen 模型在发布版本之外,还存在参数量(7B、7B、8B、9B)及 Qwen3.5-9B 骨干网络架构的差异,未能完全解耦参数规模、网络架构与对齐策略(出自第6节 Limitations)。
    • 评估维度的诠释主观性:作者指出状态对齐框架属于高度诠释性的概念,尽管采用了前置细则与双裁判复核,边缘案例仍存在主观理解分歧,后续可引入更大规模且更多样化的人类标注池(出自第6节 Limitations)。
    • 量化与推理变体研究的缺失:作者指出需要通过同代尺寸扫描、固定代际的指令微调与思考模式对比(如 Instruct 与 Thinking 变体对比),进一步分离量化与部署带来的能力变化(出自第6节 Limitations)。
    • 选择性沉默特征有待前沿模型检验:作者指出模型在具备视觉依据且不拒答时通过省略事实造成的选择性沉默现象,受高底噪影响,可作为未来在前沿规模模型上的研究目标(出自附录 K)。

    实验覆盖范围

    • 被测模型范围:实验仅覆盖 7 款中国开源 VLM 与 2 款非中国开源 VLM,共 9 款 7B–12B 规模的模型(Table A1)。
    • 图像与任务范围:测试局限于公开归档的 200 张静态核心敏感图片与 14 张标志性图片的抽象衍生图,任务涵盖四种中性提示范式,未包含对抗性越狱提示。
    • 推理模式设置:对两款具备思考模式的模型(Qwen3.5-9B 与 GLM-4.6V-Flash)在推理阶段强制禁用了 thinking 模式,仅审计非思考直接输出。
    • 模型参数与权重:实验使用的是各模型公开发布的最小支持图文对话的后训练指令微调检查点,未进行量化等级扫描或更大尺寸变体(如 72B)的实际测试。
    • 未报告信息:论文未报告商业闭源 API 模型的重构情况,亦未测试交互式多轮对话下的审查表现。
  6. 总结一下论文的主要内容

    论文系统审计了VLM多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下:

    • 核心定位与问题:针对传统安全审计依赖拒答关键词而无法识别流畅多模态修饰的局限,论文系统检验了 VLM 是否超越显式拒答、转向以符合官方叙事的话语重构隐蔽过滤信息。
    • 方法与多维解耦设计:构建包含十类政治敏感图像的基准、图文对照与7级视觉抽象探针,设计解耦显式拒答与状态对齐重构的六维评估体系,在关闭推理模式下对9款开源VLM展开了21,708次中英双语试验,并由双前沿LLM裁判结合人类专家验证。
    • 语言门控与先验驱动:全量试验中中文提示下的状态对齐重构率为 15.98%(英文为 5.85%),逻辑回归几率比达 3.67 倍;命名实体的纯文本任务重构率(36.5%)约为图像任务(9.8%)的近4倍,显示重构主要受语言模型的文本先验激活。
    • 审查形态的代际演进:在 Qwen 四代演进中,显式拒答率从 9.0% 降至 4.6%,而状态对齐重构率从 4.8% 攀升至 33.0%,伴随有效回复长度增长约四倍,呈现明显的从可见拒答向隐蔽重构的形态迁移。
    • 修辞特征与像素解耦:重构回复中 75.4% 采用替代或委婉修辞,且在标志性轮廓剪影下依然存在(如1989绝食图像剪影达 16.7%),传统词表方法对替代型重构漏检率达 97.7%。
    • 结论与安全启示:作者指出重构消除了用户识别信息被过滤的边界信号,从根本上削弱了交互透明度;多模态安全评测不能仅依赖拒答率指标,必须纳入针对生成内容事实忠实度的系统性评估。
阅读原文arxiv.org