跳到正文
原文
论文追踪· arXiv:2607.24017· Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang·本站收录 · 原文发表

多模态大模型注意力中的语义与结构偏差解耦:SPAR 免训练干预方法

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

SPAR 在注意力流形上分离文本结构偏置并重分配视觉注意力,以减轻 MLLM 自发与诱导幻觉。

威胁模型诱导幻觉(Gaslighting):欺骗性用户提示迫使 MLLM 放弃视觉依据、优先服从语言。

问题
MLLM 的文本对视觉注意力存在与查询无关的结构偏置,稀释语义视觉信号,使模型在自发幻觉和诱导式 gaslighting 下更依赖语言先验。
方法
SPAR 是免训练的即插即用干预:用文本维边际估计结构偏置模板,按视觉显著性加权减去该偏置,再按稀疏度置信度把被减掉的概率质量重分配给剩余视觉区域。只注入前两层 Transformer。
实验与结果
在 LLaVA-v1.5 上,Regular+SPAR 将 POPE Accuracy 从 76.69 升至 85.20,CHAIR_S 从 55.0 降至 49.0。GaslightingBench 上 LLaVA-v1.5 的 After-Negation Acc 为 41.74%,LLaVA-NeXT 为 34.04%,延迟接近原模型。
局限与可以继续做的
作者指出公式 (3) 是建模近似、结构偏置可能随生成变化,并计划把 SPAR 扩到更多架构与任务。实验主要在 LLaVA 系列上做 POPE、CHAIR 与否定式 gaslighting,超参为 λ=1.0、β=1.0、τ=0.1,注入前两层。
实验设置LLaVA-v1.5、LLaVA-1.5-7B 等 · POPE、CHAIR 等 · Precision、Recall 等
威胁模型
诱导幻觉(Gaslighting):欺骗性用户提示迫使 MLLM 放弃视觉依据、优先服从语言。攻击者控制文本提示(否定式 gaslighting),受害系统为开源 MLLM(LLaVA-v1.5、LLaVA-NeXT);知识设定论文未用 white-box/black-box 等词标明。
模型
LLaVA-v1.5LLaVA-1.5-7BLLaVA-NeXTLLaVA-v1.6-vicuna-7bLLaVA-v1.6-mistral-7bQwen2.5-VLInternVL2.5
基准
POPECHAIRMMEGaslightingBenchMMMUAI2DiagramMMBench
指标
PrecisionRecallF1 ScoreAccuracyCHAIR_SCHAIR_IBefore-Negation AccAfter-Negation AccInference Delay
AI 导读全文 279 字

研究者提出 SPAR(Saliency-guided Purification and Adaptive Redistribution),一种免训练、即插即用的推理干预方法,用于缓解多模态大语言模型(MLLMs)中普遍存在的结构性偏差。该偏差使模型过度关注语义无信息的视觉 token(即"register"或"Visual Attention Sinks"),导致语义视觉信号被稀释,进而引发多模态幻觉。SPAR 通过净化结构噪声并将回收的注意力预算重新分配给信息量最大的视觉区域,在多个幻觉基准上有效恢复了真实视觉 grounding,且计算开销可忽略。

深度解读

6 个问题,约 7,600 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    结构偏置稀释视觉语义信号,SPAR 要在推理时把它从注意力中分离出去。

    MLLM 的注意力流形里,与查询无关的结构偏置盖过语义视觉信号,导致自发幻觉和诱导幻觉。

    • 场景:作者认为幻觉使回答与视觉证据不一致,妨碍可靠使用。除内部噪声或统计先验引起的自发幻觉外,诱导幻觉(Induced Hallucinations,或 Gaslighting)更严重:欺骗性用户提示迫使模型放弃视觉依据,优先服从语言 [36]。
    • 现有不足:对比解码通常每个生成 token 需要多次前向,拖慢生成。注意力校准方法把注意力从孤立的 sink token 挪走,但带来较大推理延迟;只遮盖离散 sink 也处理不了更广泛的结构偏置。
    • 核心观察:作者把 register 或 Visual Attention Sink 看成更广现象的局部症状,即广义的文本到视觉注意力偏置。softmax 的单位和约束把剩余概率质量摊到无信息区域;作者用 Polya 瓮类比,认为 RoPE 等初始不对称会被强化成固定位置偏置。Figure 1 中,不同文本查询下高注意力仍集中在固定图像区域。Figure 2 中,作者称 text-to-image 的结构偏置强于 text-to-text,尤其在前两层。
    • 提出方法:作者提出语义–结构解耦(Semantic-Structural Decoupling)视角,并给出免训练、即插即用的 SPAR(Saliency-guided Purification and Adaptive Redistribution):净化结构噪声,再把回收的注意力预算分给信息量更高的视觉区域。
    • 威胁模型:
      • 目标是减轻两类视觉不一致:自发幻觉,以及诱导幻觉下模型放弃视觉依据、服从语言。
      • 受害系统是 MLLM。实验用 LLaVA-1.5-7B 与 LLaVA-NeXT;附录还涉及 Qwen2.5-VL 与 InternVL2.5。
      • 诱导设定中,攻击通过欺骗性文本实现。核心评测用否定式 gaslighting:先答中性基线问题,再施加否定提示。论文未用 white-box、black-box 或 no-box 标明攻击者知识。
      • 成功以视觉依据是否被保留来看:POPE 的判别准确率、CHAIR 的物体幻觉率,以及 gaslighting 前后的准确率。
  2. 有哪些相关研究?

    相关工作分注意力汇、MLLM 幻觉干预和诱导幻觉三条线,SPAR 针对广义结构偏置而非孤立 sink。

    注意力汇(Attention Sink)

    • Xiao et al. [32]:LLM 把不成比例的高注意力分给少数 token,通常是开头几个,并形成对早期 token 的强偏置。
    • Cancedda et al. [3]:汇常集中在第一个 token,并归因于其隐藏状态范数大。另一些工作观察到汇也可出现在位置不固定的语义弱 token 上 [27, 33]。
    • Timothée et al. [7]:ViT 推理中常出现高范数 token,主要来自低信息背景。Seil et al. [16] 在 MLLM 中研究 Visual Attention Sink,并提出注意力再分配。

    MLLM 幻觉与推理时干预

    • 早期工作用专门数据集做指令微调 [11, 28]。作者认为有效,但训练开销大。
    • 对比解码用成对输出的 logits 对比来减轻幻觉 [1, 5, 8, 18],通常需要多次查询。Wang et al. [30] 尝试单查询、单层干预。
    • PAI [22] 在解码时提高对图像 token 的注意力。HGAI [12] 用注意力透镜定位并修正中间层物体幻觉。CasualMM [35] 从因果上抑制导致错误预测的模态先验。MemVR [37] 在记忆空间对视觉输入做二次查看。

    诱导幻觉

    • GaslightBench [36] 评测模型对语言压力(gaslighting)的韧性。GasEraser [14] 把该压力下触发的异常注意力模式移走。GasVideo [29] 把基于否定的 gaslighting 扩到视频 LLM。

    基线与基准

    • 自发幻觉基线:Regular(多项式采样)、AGLA [1]、ONLY [30]、VAR [16];附录主表还含 OPERA [10]、DOLA [6]、VCD [18]。基准为 POPE [20]、CHAIR [25]、MME [9] 幻觉子集。
    • 诱导幻觉基线:无干预、Preemptive Prompt Hardening、GasEraser [14]。基准为 GaslightingBench [36],以及 MMMU [34]、AI2Diagram [17]、MMBench [23]。

    作者把 SPAR 定位为:不针对孤立 sink,而把结构偏置当作叠在注意力流形上的广义噪声层,用视觉显著性解耦并恢复视觉 SNR,且免训练、延迟低。

  3. 论文如何解决这个问题?

    SPAR 用文本维边际估计结构偏置,按显著性减去后再按稀疏度把概率质量还回去。

    SPAR 把观测到的文本到图像注意力看成语义信号加结构偏置,先估计并减去偏置,再把被减掉的概率质量按置信度还回剩余区域。干预免训练,注入前两层 Transformer。

    问题设定与形式化

    • 输入:图像经视觉编码器与投影得到视觉 token,与文本 token 拼接后做 softmax 注意力。单位和约束使语义对应很弱时仍要分配注意力质量;指数放大还会放大键范数上的小差异,高方差视觉 token 成为 sink。
    • 分解:观测注意力 A_obs 写成语义注意力、结构偏置与随机近似误差之和。结构偏置定义为对文本查询的期望,实现上对查询取平均,与具体文本无关。语义注意力是去掉该偏置后的潜在对齐。
    • 后验坍缩:下一 token 后验由语言先验与视觉似然组成。作者定义视觉 SNR 为语义注意力能量相对偏置加噪声能量之比。Corollary 1 称 SNR 趋近 0 时,后验与语言先验的 KL 上界趋于 0。自发幻觉对应内部偏置压低视觉似然;诱导幻觉对应欺骗性文本把语言先验推向某一候选子空间,低 SNR 下视觉似然压不住该先验。证明提纲在附录 A。

    显著性引导的结构偏置净化

    • 为何不直接全局压制高频注意力:作者称可能抹掉必须保留的视觉信号,也可能抬高低频噪声。因此分两阶段:净化,再重分配。
    • 显著性:对每个视觉 token 的隐藏状态算特征方差,按均值和标准差标准化后过 sigmoid,得到 S_j。稳定项 ε 举例为 1e-6。假设来自 [16, 27]:特征空间方差极高的视觉 token 充当注意力汇。
    • 偏置模板与减法:对文本维求边际,得到每个视觉位置的平均注意力 Ā_j,作为与查询无关的空间偏好。净化为 ReLU(A_i,j − λ·(1+β S_j)·Ā_j)。λ、β 为超参。实验取 λ=1.0、β=1.0。

    自适应概率重分配

    • 置信度:净化会减少注意力总质量。作者称直接重归一化可能放大残余噪声。对每个文本 token,用净化后最大值占该行质量和的比例作为稀疏度 ρ_i,再经 sigmoid 得到 γ_i,阈值 τ_sparsity 实验取 0.1。ρ_i 高表示净化后已定位到特定区域。
    • 还回预算:被减掉的质量 Δ_i 按 γ_i 比例加回,得到缩放系数 r_i,最终注意力为净化值乘 r_i。作者称这会加强弱但正确的语义对齐,并压住含糊噪声。Figure 4 概括为:提取各头 text-to-image 图、估计偏置、减去、再重分配。

    注入位置与实现

    • LLaVA-v1.5 与 LLaVA-NeXT 都只在最初两层 Transformer 注入 SPAR。作者在 Figure 2 中称前两层 text-to-image 结构偏置更强,此时视觉与语言尚未深度交互。
    • 解码默认是多项式采样,记为 Regular。SPAR 可与 AGLA、ONLY、VAR 叠加。全部实验在 NVIDIA RTX A6000 上完成。附录 G 做超参敏感性分析。

    成功判定

    • 自发:POPE 做物体存在的二分类探测,报 Precision、Recall、F1、Accuracy;CHAIR 在图像描述上量化被提及物体是否有视觉依据,CHAIR_S 与 CHAIR_I 越低越好,描述最大生成长度 128。MME 幻觉子集看属性与存在类感知。
    • 诱导:两阶段协议。Before-Negation 是原问题上的准确率,After-Negation 是施加否定式 gaslighting 提示后的准确率。附录 E 给出该任务细节;附录中的提示示例只说明协议,此处不复述具体措辞。
  4. 论文做了哪些实验?

    LLaVA 上 SPAR 提高 POPE 准确率并抬升 gaslighting 后准确率,延迟接近原模型。

    实验设置

    • 模型:主实验为 LLaVA-1.5-7B(表中写作 LLaVA-v1.5)与 LLaVA-NeXT。附录 D 还报告 LLaVA-v1.6-vicuna-7b、LLaVA-v1.6-mistral-7b、Qwen2.5-VL、InternVL2.5。
    • 基准:自发幻觉用 POPE、CHAIR,以及 MME 幻觉子集。诱导幻觉用 GaslightingBench;泛化用 MMMU、AI2Diagram、MMBench。论文未在正文给出各基准样本条数。
    • 基线:自发侧为 Regular、AGLA、ONLY、VAR;附录表另有 OPERA、DOLA、VCD。诱导侧为无干预、Preemptive Prompt Hardening、GasEraser。GasEraser 的预算来源在表中记为 sink token,SPAR 记为 structural bias。
    • 指标:POPE 的 Precision、Recall、F1、Accuracy;CHAIR_S、CHAIR_I;gaslighting 前后准确率;推理延迟(s/it)。MME 报总分及存在、计数、位置、颜色子项。
    • 实现:前两层注入;λ=1.0,β=1.0,τ_sparsity=0.1。CHAIR 最大生成长度 128。论文未报告重复次数或随机种子。
    • 评审:POPE 与 gaslighting 按准确率等指标汇总。论文未在正文写明用哪个模型做评审或判定阈值。CHAIR 的计算细节指向附录 F。

    主结果

    Table 1 是 LLaVA-v1.5 上的自发幻觉;Table 2 是 GaslightingBench 上的诱导幻觉。

    表格较宽,可左右滑动

    设置POPE AccPOPE F1CHAIR_SCHAIR_I出处
    Regular76.6979.7255.016.3Table 1
    Regular+SPAR85.2085.4249.014.0Table 1
    AGLA+SPAR80.7083.7033.411.9Table 1
    ONLY+SPAR81.1683.8431.412.5Table 1
    VAR84.2584.6143.213.8Table 1
    VAR+SPAR85.1985.5940.412.4Table 1
    LLaVA-v1.5 / +SPAR After24.71 / 41.74——0.41 / 0.42 s/itTable 2
    LLaVA-NeXT / +SPAR After19.81 / 34.04——0.81 / 0.82 s/itTable 2
    • 自发:作者称相对 Regular,SPAR 把 POPE Accuracy 提高 8.51 个百分点、F1 提高 5.70 个百分点,并把 CHAIR_S 从 55.0 降到 49.0、CHAIR_I 从 16.3 降到 14.0。与 AGLA、ONLY、VAR 叠加后两项基准都更好。VAR+SPAR 的 POPE F1 为 85.59、CHAIR_I 为 12.4,作者称是该表综合最好的一组。例外:VAR+SPAR 的 POPE Precision 为 84.11,低于 VAR 的 84.14;Regular+SPAR 的 Recall 为 85.72,低于 Regular 的 90.42。
    • 诱导:LLaVA-v1.5 上 After-Negation 从 24.71% 到 SPAR 的 41.74%,GasEraser 为 40.95%,Preemptive Prompt Hardening 为 33.89%。LLaVA-NeXT 上 SPAR 为 34.04%,GasEraser 为 30.58%,无干预为 19.81%。Before-Negation 上 LLaVA-v1.5+SPAR 为 63.71%,高于无干预的 63.25%;LLaVA-NeXT+SPAR 为 65.30%,低于无干预的 65.89%。延迟上 SPAR 为 0.42 与 0.82 s/it,接近对应无干预的 0.41 与 0.81;GasEraser 为 1.05 与 1.68 s/it。
    • Figure 3:作者称 SPAR 对自发与诱导幻觉都更稳,且推理开销小。图注写 (a) 为 gaslighting、(b) 为 CHAIR,坐标为推理延迟与 gaslighting 后准确率或实例幻觉率。正文对 (a)(b) 与图注的对应关系不一致,具体点的坐标论文未以表格给出。

    诱导幻觉的跨基准结果

    Table 3 在 LLaVA-v1.5 上比较无干预、GasEraser 与 SPAR 的 gaslighting 前后准确率。

    • 测了什么:MMMU、AI2Diagram、MMBench,以及三者平均。正文说扩展结果在 Table 9,数字与 Table 3 的平均行相同;分项以 Table 3 为准。
    • 结果:After 准确率上,SPAR 在 MMMU 为 27.96(基线 22.14,GasEraser 25.86),AI2Diagram 为 36.77(基线 29.48,GasEraser 32.39),MMBench 为 46.05(基线 26.80,GasEraser 41.77),平均 36.93(基线 26.14,GasEraser 33.34)。
    • 作者解读:作者称优势在每个数据集上都保持,因此与底层数据分布无关。Before 上 SPAR 接近或略高于基线(MMMU 36.47 对 37.56,AI2Diagram 49.08 对 49.66,MMBench 72.19 对 72.07),GasEraser 的 Before 均低于基线。

    组件消融

    Table 4 改变结构偏置估计时对图像侧、文本侧做不做边际化,指标是 LLaVA-v1.5 在否定前后的准确率。Table 5 去掉 SPAR 的子模块,基准为 GaslightingBench。

    • 边际化:只做图像侧时 After 为 34.28;只做文本侧时 Before 63.71、After 41.74;两侧都做时 Before 64.10、After 41.18;两侧都不做时 Before 63.25、After 33.89。作者称文本侧边际化增益更大,且与联合边际化相当,并称这与“结构偏置是与查询无关的 text-to-image 模式”一致。
    • 模块:Full 为 63.71 / 41.74。去掉 Saliency Guidance 为 62.10 / 35.20;去掉 Probability Redistribution 为 60.78 / 33.91;去掉 Sparsity Guidance 为 57.86 / 36.13。作者称去掉稀疏度引导使 Before 下降 5.85 个百分点,去掉概率重分配使 After 降到 33.91,完整 SPAR 需要各模块一起用。
    • 定性:Figure 5 在 LLaVA-v1.5 上对比有无 SPAR 的 text-to-image 图。作者称基线存在持续、与语义无关的偏置,SPAR 压低该偏置并把注意力收到对应视觉实体上。Figure 12 给出 GaslightingBench 定性例,附录中 SPAR 在部分例上仍选与误导提示不同的选项;具体问答原文不复述。

    其他消融与分析

    • 附录 I 给出 POPE 三个子集的细项,正文未在主表逐项展开。
    • 附录 G:λ、β、τ_sparsity 的敏感性;正文未列出扫描曲线上的每个点。
    • 附录 B:结构偏置的进一步经验分析;附录 A 为 Corollary 1 的证明提纲。
    • MME 幻觉子集:正文称 SPAR 提升感知项,具体子分数在附录表中;与 Table 1 无法逐格对齐的数字此处不转写。
    • Figure 2:作者称 LLaVA-NeXT 上 text-to-image 平均注意力的结构偏置强于 text-to-text,且集中在前两层。热图数值未在正文逐格列出。
    • 负面数字:LLaVA-NeXT+SPAR 的 Before-Negation(65.30%)低于该模型无干预(65.89%);GasEraser 在 Table 3 的三个 Before 上都低于 LLaVA-v1.5 基线。
  5. 有什么可以进一步探索的点?

    作者把分解式视为近似,并计划扩展到更多架构;主实验集中在 LLaVA 与否定式诱导。

    作者指出的局限与后续方向

    • 建模近似:公式 (3) 的加性分解是对注意力流形的近似,结构偏置不一定在整段生成中保持恒定(附录,局限说明)。
    • 估计方式:结构偏置模板由当前样本的文本维平均得到,作者认为它捕获的是头内的稳定空间偏好,而不是跨样本训练出的偏置(方法与附录讨论)。
    • 注入范围:干预放在前两层,依据是 Figure 2 中早期层的 text-to-image 偏置更强;作者未声称更深层不存在同类偏置(第 4 节与 Figure 2)。
    • 后续方向:作者计划把 SPAR 扩展到更多 MLLM 架构和更多任务(结论)。论文未把代码发布写成已完成。
    • 延迟表述:作者称开销可忽略。Table 2 给出的是 0.42 对 0.41 s/it、0.82 对 0.81 s/it,没有更细的延迟分解。

    实验覆盖范围

    • 被测开源 MLLM 在主文为 LLaVA-1.5-7B 与 LLaVA-NeXT;附录 D 另列 LLaVA-v1.6-vicuna-7b、LLaVA-v1.6-mistral-7b、Qwen2.5-VL、InternVL2.5。
    • 自发幻觉指标覆盖 POPE、CHAIR(最大生成长度 128)和 MME 幻觉子集;诱导协议是先答中性问题,再加否定式 gaslighting。
    • 诱导泛化报告了 MMMU、AI2Diagram、MMBench 的 Before/After 准确率(Table 3),平均 After 为 SPAR 36.93%、GasEraser 33.34%、LLaVA-v1.5 26.14%。
    • 超参固定为 λ=1.0、β=1.0、τ_sparsity=0.1,注入层为最初两层;敏感性放在附录 G。论文未报告每个条件的重复次数。
    • 对比基线在自发侧包括 Regular、AGLA、ONLY、VAR,附录另有 OPERA、DOLA、VCD;诱导侧为 Prompt Hardening 与 GasEraser。论文未报告 SPAR 与这些方法之外的防御组合,也未报告人工一致性。
  6. 总结一下论文的主要内容

    SPAR 用显著性净化文本结构偏置并重分配注意力,在 LLaVA 上同时压低自发幻觉、抬升 gaslighting 后准确率。

    SPAR 是一种免训练的 MLLM 推理时干预,用来把注意力里的结构偏置和语义视觉信号分开。

    • 问题:作者认为 softmax 的单位和约束与位置编码不对称会形成与查询无关的文本到视觉偏置。该偏置稀释视觉 SNR,使后验滑向语言先验。这既对应自发幻觉,也对应欺骗性文本下的诱导幻觉。孤立地处理 sink token 覆盖不到这一层偏置,而且部分现有干预更慢。
    • 方法:在前两层,对 text-to-image 注意力沿文本维取平均得到偏置模板,用视觉特征方差做成的显著性图加权后减去,再用稀疏度置信度把减掉的概率质量乘回剩余位置。默认 λ=1.0、β=1.0、τ_sparsity=0.1,可与现有解码策略叠加。
    • 自发幻觉:LLaVA-v1.5 上 Regular+SPAR 的 POPE Accuracy 为 85.20、F1 为 85.42,CHAIR_S 为 49.0、CHAIR_I 为 14.0(Table 1)。VAR+SPAR 的 F1 为 85.59、CHAIR_I 为 12.4。VAR+SPAR 的 Precision 略低于单独 VAR。
    • 诱导幻觉:GaslightingBench 上,LLaVA-v1.5+SPAR 的 After-Negation 为 41.74%(无干预 24.71%,GasEraser 40.95%),延迟 0.42 s/it;LLaVA-NeXT+SPAR 为 34.04%(无干预 19.81%),延迟 0.82 s/it(Table 2)。Table 3 平均 After 为 36.93%,高于基线 26.14% 与 GasEraser 33.34%。LLaVA-NeXT 的 Before 从 65.89% 降到 65.30%。
    • 作者结论:作者认为 SPAR 以接近原模型的延迟同时减轻两类幻觉,并且文本侧边际化比图像侧更能估计要去掉的偏置。加性分解被作者视为近似,结构偏置未必在整段生成中不变。
阅读原文arxiv.org