跳到正文
原文
论文追踪· arXiv:2609.37837· Haotian Deng, Wenbin Xing, Gang Xu, Tao He, Jinkai Zheng, Chun Li, Zheng Zhu, Ming Li·本站收录 · 原文发表

Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

Can Vision-Language Models Stay Helpful When Facing Implicit Risks? Intent-Privilege OPSD for Efficient Safety-Helpfulness Alignment

论文速读

对齐/训练方法

据论文 PDF 整理(AI 生成),以原文为准

Intent-Privilege OPSD 用 1447 条证据化意图,在单次 rollout 中把教师偏好蒸馏给学生;SIUO+HoliSafe 上联合成功从 43.9% 升至 53.5%。

问题
视觉语言模型在图像与文本单独看无害、合在一起才有风险时,容易给出不安全回答;现有偏好对齐、多 rollout 强化学习和推理期防护数据或算力开销大,还常以直接拒答牺牲有用性。
方法
用多智能体流水线把意图重标为可核对的证据化特权,训练时只给冻结教师;学生只看原图文,每条提示词做一次 on-policy rollout,用 top-32 前向 KL 蒸馏教师的 token 级续写偏好,并混入通用锚点。推理时去掉教师和特权。
实验与结果
在 Qwen3-VL-4B 的五组安全评测上,Joint Success 均为最高或与 Base 并列。SIUO+HoliSafe 从 43.9% 到 53.5%。去掉特权、换用原始意图或打乱意图都会下降。通用能力 Aggregate 为 54.5,相对 Base 的 53.3。
局限与可以继续做的
作者指出 curated 基准之外的泛化仍难,现有协议只部分衡量校准后的安全与有用性,并计划做更广的交互评测。实验主干是 Qwen3-VL-4B,附录另有 LLaVA;安全评审为 GPT-5.6 Sol。
实验设置Qwen3-VL-4B-Instruct、LLaVA-1.5-7B 等 · SIUO、HoliSafe 等 · Joint Success、Safety S 等
模型
Qwen3-VL-4B-InstructLLaVA-1.5-7BInternVL2-8B
基准
SIUOHoliSafeBeaverTails-VMSSBenchMOSSBenchMM-SafetyBenchMMStarMME-RealWorld
指标
Joint SuccessSafety SHelpfulness HFSRMMStarMME-RealWorldAggregate
AI 导读全文 293 字

针对视觉语言模型(VLM)跨模态隐式风险,研究者提出 Intent-Privilege On-Policy Self-Distillation(OPSD),用基于证据的意图作为训练期特权监督,把教师的意图条件偏好蒸馏给学生,每个提示词只需一次 rollout,推理时无需意图标注或额外安全模块。该方法仅用 1,447 条安全样本(比标准偏好数据集少 95%),训练时间较多次 rollout 的 GRPO 式训练减少 5 倍,平均推理长度降低 7%。在全部五个评测组中,OPSD 取得最高的安全-有用联合成功率,在 SIUO+HoliSafe 合并集上从 43.9% 升至 53.5%。

深度解读

6 个问题,约 7,600 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    跨模态隐式风险下,如何用更少数据同时保住安全与有用性。

    视觉语言模型面对跨模态隐式风险时,往往要么给出不安全协助,要么直接拒答而损失有用性;作者要问,能否用少得多的数据把两者一起对齐。

    • 场景。 作者认为,图像和文本各自看起来无害、合在一起才暴露风险时,模型必须根据模态关系做判断,而不是只检测显式有害内容。Fig. 1(b) 中,隐式风险设置下不安全回答率从 30% 到超过 64%(作者称详细分析见 Sec. D)。
    • 现有方法的不足。 作者把主流方法分成三类:大规模偏好对齐、基于 GRPO 的多次 rollout 强化学习,以及推理期额外检查。作者称它们数据、训练或延迟成本高,并且可能靠拒绝本可安全回答的请求来提高表面上的安全性。
    • 核心观察。 作者认为意图可以只在训练时作为特权信息:教师看到意图,学生只从原图文学习。但现有意图标注会写入输入并不支持的动机,或把含糊请求判成有害。诊断中,给冻结的 Qwen3-VL-4B-Instruct 加上 Source Privilege,首句拒答从 12.9% 升到 45.0%,联合成功从 25.0% 降到 11.7%(Table 1)。
    • 提出的方法。 Intent-Privilege OPSD:先重标证据化意图,再把冻结教师在学生自身轨迹上的意图条件续写偏好,用每条提示词一次 rollout 蒸馏给学生;推理时不再使用意图标注或额外安全模块。
  2. 有哪些相关研究?

    相关工作分隐式跨模态安全、安全–有用性对齐,以及特权信息与 on-policy 自蒸馏。

    引言与附录 A 把相关工作分成三组。附录 A 的具体条目在本次可见文本中只给出分组标题,下面只写正文点名并讨论过的工作。

    跨模态隐式安全与意图

    • FigStep(Gong 等, 2025)与 VLGuard(Zong 等, 2024)——研究显式威胁和越狱;作者称现有 VLM 在这些设置上表现较好,但在隐式风险上不安全回答率仍高。
    • Wang 等(2025)、Zhou 等(2025)、Na 等(2025)、Zhang 等(2025)——用意图刻画跨模态风险、评估情境安全或引导回答。作者把意图改作仅训练期使用的特权监督,而不是推理时的额外步骤。
    • Meerkat-VL(Zhou 等, 2026)——把感知自验证和迭代采样结合起来做隐式风险对齐;作者称这显著增加训练成本。其 Meerkat-Safe 的原始意图标注被用作 Table 1 的 Source Privilege。

    安全–有用性对齐

    • Safe RLHF-V(Ji 等, 2025)——用分开的奖励模型和代价模型建模有用性与安全;作者称它需要大量偏好数据才能覆盖多样的多模态情境。
    • SPA-VL(Zhang 等, 2024)、VLGuard、Think in Safety(TiS)、SafeGRPO(Rong 等, 2025,基于 Shao 等 2024 的 GRPO)——正文将其作为对比的偏好对齐、安全微调或多次 rollout 方法。
    • Lee 等(2025a)、Wen 等(2026)、Chen 等(2026)、Li 与 Zhan(2026)——在推理时过滤输入或输出;作者称这会增加部署延迟。

    特权信息与自蒸馏

    • OPSD(Zhao 等, 2026)以及 Agarwal 等(2023)、Hinton 等(2015)、Snell 等(2022)——在学生自己生成的回答上做 on-policy 蒸馏。作者用它把意图条件偏好迁到不看特权的学生上。
    • LoRA(Hu 等, 2022)——只更新学生的低秩适配器,教师保持冻结。

    基线与基准。 安全对比基线为 Base、SPA-VL、VLGuard、TiS、SafeGRPO。评测使用 SIUO(Wang 等, 2025)、HoliSafe(Lee 等, 2025b)、BeaverTails-V、MSSBench、MOSSBench(Li 等, 2024)、MM-SafetyBench(Liu 等, 2023b),以及通用能力上的 MMStar、MME-RealWorld。

    作者把本文定位为:用可核对证据约束意图,并且只在训练时使用;学生部署时不再依赖特权标注或额外安全阶段,同时用单次 rollout 降低相对多次 rollout GRPO 的训练成本。

  3. 论文如何解决这个问题?

    重标证据化意图,再用单次 rollout 的前向 KL 把它蒸馏进学生。

    Intent-Privilege OPSD 先构造不含拒答指令的证据化意图 z,训练时只给冻结教师;学生只看原图文生成一条回答,用 token 级前向 KL 对齐教师在同一前缀上的续写分布,推理时丢弃教师和 z。

    问题设定

    • 输入与策略。 风险来自单独看无害的图像 v 与文本 x 的组合。部署学生为 πS(y | v, x),训练教师为 πT(y | v, x, z)。z 只在训练时出现,记录任务语义和输出边界,不规定固定拒答策略或参考回答。
    • 两个目标。 作者要在谨慎拒绝和有用建议之间取得平衡,并在部署时去掉特权和辅助推理组件。更完整的理论讨论作者指向 Sec. B。

    证据化意图

    • 四段流水线。 Fig. 3:Qwen3.5 35B 分别只看图像、只看文本抽取证据;GPT-5.6 builder 结合原图文和两路证据写联合意图;GPT-5.6 auditor 按五条标准审核。通过者还要经过局部人工检查,核对格式、禁止内容和长度。标注智能体看不到 Source Privilege、安全标签或参考回答。
    • 保留与排除。 z 记录可见证据、模态关系、未决问题、合理的良性解释和有条件的输出边界。不支持的动机、显式安全标签、拒答指令和现成回答被排除。安全或含糊样本不会仅因没有确认危害而被滤掉。最终保留 1,447 条。

    单次 rollout 蒸馏

    教师和学生从同一 VLM 检查点初始化。教师全程冻结,只更新学生 LoRA。同一前缀上,教师分布 qt 额外条件于 z,学生分布 pt 只条件于 (v, x)。蒸馏温度均为 1,与采样配置分开。教师不对另一条补全再生成,而是在学生采样序列上做一次因果前向。

    采用 top-k OPSD,k=32,并设一个聚合尾桶。长度为 L 的回答上,目标是教师分布到学生分布的前向 KL 沿 token 平均:

    LOPSD = 1/L∑t=1L DKL(sg[q̄t] ∥ p̄t)

    sg 阻断教师梯度。提示词和 padding 位置不计入。每条提示词只采样一次。

    锚点、优化与部署

    • 安全锚点。 1,447 条主样本上的 OPSD 与 2,500 条通用任务锚点对话的交叉熵一起优化。锚点使用相同的学生系统指令和已有参考回答,无特权、无额外 rollout。
    • 步损失。 常规步 m=8、a=2,两个均值损失的有效权重为 0.8 和 0.2,梯度累积后更新。
    • 部署。 只保留适配后的学生,从 πθ(· | v, x) 直接生成。不使用安全分类器、路由器、强制安全标签或思维链阶段。

    成功判定

    模型盲的 GPT-5.6 Sol 给安全分 S∈[−3, 3] 和有用性 H∈[0, 3]。Joint Success 要求同一回答 S=3 且 H≥2。Table 1 另报告首句拒答频率 FSR。通用能力用 MMStar 与 MME-RealWorld 的抽取答案正确性,不用安全评审。

  4. 论文做了哪些实验?

    五组安全评测上 Joint Success 最高或并列,打乱意图后增益基本消失。

    实验设置

    • 骨干与训练。 主实验骨干为 Qwen3-VL-4B-Instruct。OPSD 用 1,447 条带 Evidence-Grounded Privilege 的图文请求和 2,500 条通用锚点,只更新学生 LoRA。教师即该检查点的冻结副本。
    • 基线。 Base、SPA-VL、VLGuard、Think in Safety(TiS)、SafeGRPO。机制变体包括 No-Privilege、Source-Privilege、Shuffled EG-Privilege,以及去掉通用锚点。
    • 安全数据。 六个基准共 2,057 条输入,合并 SIUO 与 HoliSafe 后报五组:SIUO+HoliSafe 767、BeaverTails-V 200、MSSBench 400、MOSSBench 300、MM-SafetyBench 390。
    • 指标与评审。 共享生成协议下,模型盲 GPT-5.6 Sol 打 S 和 H。主指标 Joint Success 为 S=3 且 H≥2 的比例。冻结教师诊断另用 300 条输入,比较 No Privilege、Source Privilege、Evidence-Grounded Privilege 和打乱后的证据化特权。
    • 效率对照。 SPA-VL 使用 30,000 对偏好;SafeGRPO 每条提示词 8 次 rollout。训练计时为匹配的单张 NVIDIA A800 墙上时间。推理长度对照 TiS,服务配置为匹配的 vLLM。论文未报告安全评测的重复次数。
    • Fig. 1(b) 的模型。 图例为 LLaVA-1.5-7B、InternVL2-8B、Qwen3-VL-4B,横轴为 Jailbreak、Explicit、Implicit 三类攻击,纵轴为 Attack success rate (%)。附录 C 另有 LLaVA 上的对齐实验;本次可见文本未给出该附录的数字表,下面不填这些数字。

    主结果

    Joint Success(%,↑;S=3 且 H≥2)。据 Table 2。

    表格较宽,可左右滑动

    评测组NBaseSPA-VLVLGuardTiSSafeGRPOOurs
    SIUO+HoliSafe76743.950.340.845.945.453.5
    BeaverTails-V20031.044.08.532.530.549.0
    MSSBench40039.035.532.535.738.839.0
    MOSSBench30029.336.38.029.032.037.0
    MM-SafetyBench39030.332.30.325.628.734.1
    • 作者的解读。 作者称本文在五组上都达到最高联合成功,其中 MSSBench 与未适配 Base 同为 39.0%。相对 Base,SIUO+HoliSafe 从 43.9% 到 53.5%,作者称提高 9.6 个百分点(相对 21.8%)。相对该组最强已适配基线,增益分别为 3.2、5.0、0.2、0.7、1.8 个百分点。
    • 不是单纯更保守。 作者称 SIUO+HoliSafe 和专门探测良性、安全相邻请求过度敏感的 MOSSBench 同时上升(后者相对 Base 从 29.3% 到 37.0%)。因为 Joint Success 同时要求 S=3 和 H≥2,作者认为这与“只靠更激进拒答”不一致。
    • 增益不均匀。 MSSBench 上与 Base 持平。作者称较大增益出现在意图校准或过度敏感是核心的设置,而不是来自通用性能的普遍提高。

    特权是否有效

    据 Table 3,Joint Success(%)。

    表格较宽,可左右滑动

    变体SIUO+HoliSafeBeaverTails-VMSSMOSSMM-Safety
    Base43.931.039.029.330.3
    No-Privilege46.139.336.530.026.1
    Source-Privilege41.735.538.012.613.3
    Shuffled EG-Privilege43.640.535.531.031.8
    Ours53.549.039.037.034.1
    Ours w/o Anchors50.049.737.036.634.8
    • 去掉特权。 No-Privilege 在 SIUO+HoliSafe(46.1% 对 43.9%)和 BeaverTails-V(39.3% 对 31.0%)上高于 Base,但五组都低于完整方法;与完整方法的差距在 SIUO+HoliSafe、BeaverTails-V、MOSSBench、MM-SafetyBench 上为 7.4、9.7、7.0、8.0 个百分点,且在 MSSBench 和 MM-SafetyBench 上低于 Base。
    • 标注质量。 换成 Source Privilege 后每组都下降,MOSSBench 从 37.0% 到 12.6%,MM-SafetyBench 从 34.1% 到 13.3%。作者称不支持或过早下结论的意图会被蒸馏进学生。
    • 打乱对照。 Shuffled EG-Privilege 保留格式和边际内容、打乱与当前输入的对应。SIUO+HoliSafe 从 53.5% 降到 43.6%,接近 Base 的 43.9%。作者称收益依赖于针对该图文的意图,而不是任意的结构化安全文本。

    冻结教师诊断与定性例子

    Table 1 在 Qwen3-VL-4B-Instruct 上固定参数和解码,只改特权。300 条诊断集:

    表格较宽,可左右滑动

    上下文SHS=3H≥2SuccessFSR
    No privilege1.6331.85025.075.025.012.9
    Source Privilege1.7671.68311.766.711.745.0
    Evidence-Grounded1.9172.28341.795.041.712.1
    Shuffled EG1.4501.86723.376.723.317.1

    后四列是百分比。作者称 Source Privilege 使模型更保守;证据化特权把联合成功从 11.7% 提到 41.7%,FSR 从 45.0% 降到 12.1%,并高于无特权的 25.0% 和打乱条件的 23.3%。Fig. 2 给出同一请求在两种特权下的回答对照:作者称旧特权引入推测性威胁并导致防御性拒答,新特权保留不确定性。Fig. 5 是含糊的安全相邻请求,作者称若干基线要么补上缺失语境,要么宽泛拒绝,本文则保留未决条件并给有条件的建议。

    其他消融与分析

    • 通用能力(Table 4)。 Aggregate:Base 53.3,SPA-VL 50.0,VLGuard 39.8,TiS 48.0,SafeGRPO 52.9,Source-Privilege OPSD 45.5,本文 54.5,去掉锚点 46.1,Shuffled EG-Privilege OPSD 51.9。本文 MMStar 62.3(Base 64.0),MME-RealWorld 从 32.0 到 39.0。去掉锚点后 Aggregate 从 54.5 到 46.1,MMStar 下降 9.9 分;Table 3 中大部分安全增益仍在。作者把主结果解释为能力保持,而不是安全后训练系统性地提高通用多模态能力。
    • 数据与训练。 安全样本 1,447 条,对比 SPA-VL 的 30,000 对;作者称大约少 95%。每条提示词 1 次 rollout,SafeGRPO 为 8 次。A800 墙上时间从 40.88 h 到 8.05 h,作者称约 5×。作者同时写明这不是受控的数据规模实验,5× 也不应理解成理论 FLOPs 的同等下降。
    • 推理。 相对 TiS,平均生成长度从 665 token 降到 468 token(29.6%),匹配 vLLM 下推理速度提高 18%。摘要另称平均推理长度降低 7%。Fig. 6(b) 柱上延迟标注包括 11.9s、11.4s、9.6s、9.7s、9.6s 和 2.0s;作者把 2.0s 所在位置标为 Severe Over-refusal。Fig. 6(a) 的红色相对数(数据约 51.77%–95.18%,性能约 7.16%–135.96%)是相对各基线的标注,论文未在正文逐项对应到具体基线。
    • Fig. 1(b) 可读数字。 图中标出 64.07、46.71、30.53,以及靠近 0 的 0.45、0.12、0.12 和三个 0.00。作者称隐式风险上不安全率约 30% 到超过 64%,而部分显式威胁和越狱上防御并未同样失效;哪一根柱对应哪个模型,图注文字没有逐柱写明。
  5. 有什么可以进一步探索的点?

    作者认为基准外泛化仍难,现有协议只部分衡量安全与有用性。

    作者指出的局限与后续方向

    • 基准之外。 Limitations 写明,在策划过的基准设定之外,可靠的多模态安全对齐仍然困难,模型行为需要在多样语境和交互模式上泛化。
    • 评测协议。 同一节写明,当前评测协议只部分衡量校准后的安全性与有用性。
    • 后续方向。 作者因此把更广的交互评测和更强的评估方法列为未来工作的重要方向。
    • 发布计划。 Reproducibility Statement 写,接收后将发布完整代码和重标注数据集;Ethics Statement 写数据集发布将遵守源数据许可和隐私约束。这是计划,不是已经完成。

    论文的 Limitations 只有上述两点,没有单独列出失败案例或未适配的攻击类型。

    实验覆盖范围

    • 主结果模型。 Section 5 的对齐、消融、通用能力和效率实验使用 Qwen3-VL-4B-Instruct。Fig. 1(b) 还画出 LLaVA-1.5-7B 与 InternVL2-8B 在三类攻击下的攻击成功率。附录 C 标题为 LLaVA 上的附加实验,可见文本没有给出该表的数字。
    • 安全评测规模。 五组合计 2,057 条:767、200、400、300、390(Table 2)。冻结教师诊断为 300 条(Section 3.1)。通用能力在 MMStar 与 MME-RealWorld 上报告;附录 F 写明归档包记录的是这些评测的 100 条版本,模板本身不能确立完整基准覆盖。
    • 对照变体。 Table 3 包含无特权、Source Privilege、打乱证据化特权和去掉 2,500 条通用锚点。效率对照了 SPA-VL 的 30,000 对偏好和 SafeGRPO 的 8 次 rollout,硬件为单张 A800,推理对照 TiS 与匹配的 vLLM。
    • 评审。 安全与有用性由模型盲的 GPT-5.6 Sol 按 S∈[−3, 3]、H∈[0, 3] 打分。附录 F 写明历史可见参考量表和新旧双评分试点使用的量表并不统一,这些结果不应说成一律使用当前量表。论文未报告安全评审与人工评分的一致性,也未报告安全评测的重复次数。
    • 重标注模型。 Section 3.2 与 Fig. 3 写明证据抽取用 Qwen3.5 35B,联合构建和审核用 GPT-5.6。论文报告了 1,447 条入选样本,未在可见正文给出送审总数或人工复核的条数。
  6. 总结一下论文的主要内容

    证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。

    图像和文本可以各自无害、合在一起才有风险。作者认为直接使用现有意图标注会教模型过度拒绝:冻结的 Qwen3-VL-4B-Instruct 上,Source Privilege 使首句拒答从 12.9% 升到 45.0%,联合成功从 25.0% 降到 11.7%。

    方法分两步。多智能体流水线只根据可见图文重写意图,排除不支持的动机、安全标签和拒答指令,保留 1,447 条。训练时冻结教师看到该意图,学生只看原图文并采样一次;top-32 前向 KL 把教师在这些前缀上的续写分布蒸馏给学生,再与 2,500 条通用锚点以 8:2 的步内配比一起更新 LoRA。推理只保留学生。

    在 Qwen3-VL-4B 上,五组 Joint Success 均最高或与 Base 并列。SIUO+HoliSafe(767 条)从 Base 的 43.9% 到 53.5%,BeaverTails-V 到 49.0%,MOSSBench 到 37.0%,MM-SafetyBench 到 34.1%,MSSBench 与 Base 同为 39.0%。无特权蒸馏只解释一部分增益;换回原始意图或打乱意图后,SIUO+HoliSafe 分别降到 41.7% 和 43.6%。通用 Aggregate 为 54.5,相对 Base 的 53.3;去掉锚点降到 46.1。相对 SafeGRPO,A800 训练时间从 40.88 h 到 8.05 h。

    作者的结论是:意图监督只有在对应可观察证据时才有益,过度推测的意图会放大过度拒绝;把它限制在训练期并做单次 on-policy 蒸馏,可以在更少安全数据和更少训练成本下提高联合成功,部署时不增加安全处理阶段。作者同时认为,策划基准之外的泛化以及现有评测对校准安全与有用性的覆盖仍然有限。

阅读原文arxiv.org