SECRET:用源条件化中继引导缓解音视频大语言模型的幻觉
Devils in Question Relay: Source-Conditioned Relay Steering to Mitigate Hallucinations in Audio-visual Large Language Models
作者提出训练无关的 SECRET,在问题表征上做源条件转向,以缓解 AVLLM 的跨模态接地幻觉。
论文研究的是 AVLLM 的 source-confused grounding hallucination:非所需模态线索诱发所需模态不支持的回答。
- AVLLM 会出现 source-confused grounding hallucination:未使用模态的线索诱发所需模态并不支持的回答。现有推理时纠偏或训练时对齐能缓解,但跨模态干扰如何经内部通路产生仍不清楚。
- 路径干预显示,问题状态同时中继所需证据与干扰线索,切断干扰模态到问题 token 比切断到生成位置更能恢复正确答案 logit。SECRET 据此用对比问题表征,把原问题状态转向所需模态证据,训练无关且保留完整音视频输入。
- 在 CMM 与 AVHBench、三个 AVLLM 上,SECRET 的 Overall Acc. 高于所评训练无关方法;相对基座最高 +18.0(CMM)和 +7.1(AVHBench)个百分点。错配音视频的模态描述上,D-CIDEr 更低、LLM-score 更高。
- 附录 A 称分析集中于是非题,描述任务只测了两个 7B 模型,且未分析计算开销。诊断主要在 Qwen2.5-Omni-7B 上做;Qwen3 未评 VCD 与 AVCD。
- 威胁模型
- 论文研究的是 AVLLM 的 source-confused grounding hallucination:非所需模态线索诱发所需模态不支持的回答。受害系统为接收视频、音频与文本问题的 AVLLM;方法在推理时切断模态到问题 token 的注意力并转向问题状态,不改输入、不训练。
- 模型
- VideoLLaMA2-AV-7BQwen2.5-Omni-7BQwen3-Omni-30B-A3B
- 基准
- CMMAVHBenchmodality-specific captioning
- 指标
- AccuracyT-CIDErD-CIDErLLM-score∆Logit
针对音视频大语言模型(AVLLMs)的源混淆接地幻觉,研究通过路径干预与表征分析发现"问题中继"机制:问题状态会携带干扰模态的线索,削弱对所需模态证据的接地。据此提出免训练方法 SECRET(SourcE-Conditioned RElay sTeering),利用不同模态路径干预得到的对比问题表征,将原始问题状态引导向所需来源证据。在 CMM 和 AVHBench 两个基准、三种 AVLLMs 上,SECRET 持续优于此前的免训练方法,最高较基座模型提升 18.0 和 7.1 个百分点,并在模态特定描述任务上展现泛化性。
深度解读
这篇论文试图解决什么问题?
AVLLM 会把非所需模态线索当成答案依据,作者要在问题中继处纠正这种接地幻觉。
音频-视觉大语言模型(AVLLM)会把非所需模态的线索当成依据,给出所需模态并不支持的回答(source-confused grounding hallucination)。
- 场景与重要性:作者称 AVLLM 通过视觉、听觉与语言交互完成多模态理解,并用于自动驾驶和人机交互等场景。Fig. 1(a) 的例子是:音频只有人声、没有钢琴,可见的钢琴仍使模型幻觉出钢琴声。作者认为这种失败会削弱复杂音视频输入下的可靠性。
- 现有方法的不足:作者称现有方法通过推理时纠偏解码(Chung et al., 2026; Jung et al., 2026a)或训练时对齐(Chaubey et al., 2026; Chen et al., 2026)缓解该失败,但跨模态干扰如何由内部交互产生仍理解不足。
- 核心观察:作者报告,该失败并不只是没读懂问题要求的证据来源。路径干预显示,问题状态(question states,问题 token 位置的隐表示)同时携带所需来源证据和干扰线索;切断干扰模态到问题状态的通路,比切断到生成位置更能恢复正确答案 logit。
- 提出的方法:作者提出训练无关的 SECRET(SourcE-Conditioned RElay sTeering)。它用不同模态通路干预得到的对比问题表征,把原始问题状态转向所需来源证据,同时保留完整音视频输入。
- 威胁模型:
- 目标:减轻 source-confused grounding hallucination,使回答由问题指定的模态证据支撑,而不是由另一模态的线索诱发。
- 知识:分析针对模型内部注意力通路与隐状态;所需模态由同一 AVLLM 只看文本问题预测,记为 r̂ ∈ {A, V}。
- 能力:推理时在指定层窗口改写注意力掩码,切断某一模态到问题 token 的通路,并对问题状态做范数匹配的加性转向;不训练、不删除或扰动音视频输入。转向只在 prefill 阶段施加。
- 受害系统:接收视频 V、音频 A 与文本问题 Q 的 AVLLM。评测子集中,文本问题明确要求答案基于音频或视频。
有哪些相关研究?
相关工作分跨模态幻觉缓解与多模态信息利用的机制分析两类,本文把干预点放在问题中继。
跨模态幻觉与评测
- AVHBench(Kim et al., 2024)与 CMM(Leng et al., 2024a):作者称二者从不同干扰方向评测 AVLLM 的 source-confused grounding hallucination。本文主实验使用这两个基准。
- 推理时自适应解码:Jung et al. (2026a) 的 AVCD、Chung et al. (2026) 的 MAD、Leng et al. (2024b) 的 VCD,按模态主导、任务相关性或预测冲突调节模态贡献。作者称这些方法有效,但该失败背后的内部跨模态交互仍理解不足。
- 偏好对齐:Chen et al. (2026)、Chaubey et al. (2026)、Baid et al. (2026) 用多模态偏好对和模态感知目标,加强感官证据接地、减少不恰当的跨模态依赖。作者同样指出其内部机制理解不足。
多模态信息利用的机制研究
- 生成位置上的模态依赖:Selvakumar et al. (2026)、Yu et al. (2026) 用注意力分析与通路干预刻画生成位置的模态使用。Jiang et al. (2025)、Jung et al. (2026b) 据此做注意力调制与对比解码以减轻幻觉。作者把 SECRET 的干预点与“模态到生成位置”的常见做法相对照。
- 指令位置的模态整合:Zhang et al. (2025d; 2026b)、Suharitdamrong et al. (2026) 研究模态信息如何进入先前指令位置以支持后续预测。Zhang et al. (2026b) 的 Instruction Anchor 找出并放大参与模态仲裁的注意力头,以改善视觉-语言模型的模态遵循;Suharitdamrong et al. (2026) 用这些洞察指导 AVLLM 的 token 剪枝。
- 其他机制工作:Nikankin et al. (2025)、Kim et al. (2025)、Tong et al. (2026) 被作者归为考察模型如何整合、使用多模态信息并指导方法设计的研究。论文对它们只作归类,没有逐篇对比。
基线方法与基准
- 基线:VCD(四分支音视频扩展,表中记为 VCD)、AVCD、MAD,均为训练无关方法。被测模型为 VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B。基准为 CMM 的 Visual Dom. 与 Audio Dom.(共 800 题),以及 AVHBench 的 Video-Driven Audio Hallucination 与 Audio-Driven Video Hallucination(共 3,426 个问答对)。开放生成另用错配音视频上的模态特定描述,指标遵循 ACPO(Baid et al., 2026)的设定并增加 D-CIDEr 与 LLM-score。
作者把本文定位为:在上述缓解方法之外,考察非所需音视频线索如何经 question relay 传播并导致 AVLLM 的 source-confused grounding hallucination,再用源条件表征对比把问题状态转向所需来源证据。
论文如何解决这个问题?
SECRET 用正负通路干预构造对比问题表征,再按原状态 L2 范数把问题状态转向所需模态。
作者先用通路切断确认干扰发生在 question relay,再提出训练无关的 SECRET:保留完整音视频输入,用源条件注意力掩码造出正、负问题表征,把原问题状态推向所需模态证据。
问题设定与诊断
- 输入与记号:AVLLM fθ 把视频 V、音频 A、问题 Q 编成 X = [XV ; XA ; XQ]。r ∈ {A, V} 为所需模态,r̄ 为另一模态。XG 是完整提示词的最后位置,用于预测第一个答案 token,称为生成位置,且不计入问题 token XQ。
- 通路切断:对源 token 集 S 与目标 token 集 T,通路 PS→T 是目标对源的注意力边。在以层 ℓ 为中心的七层窗口 Wℓ 内,把这些边的掩码改为 −∞,其余掩码不变。式 (1) 是标准多头自注意力;式 (2) 是该窗口内的掩码修改。
- 诊断结论如何进入方法:在 source-faithful 样本上,切断所需模态到 XQ 使目标答案概率下降最多。在 source-confused 样本上,切断干扰模态到 XQ 比切断到 XG 带来更大的正确答案 logit 恢复(∆Logit,干预后 XG 处正确答案 logit 减去原运行)。作者因此把转向做在问题 token,而不是生成位置。
所需模态识别与掩码
- 识别:沿用 §2.2,只用文本问题提示同一 AVLLM,预测 r̂ ∈ {A, V}。Qwen2.5-Omni-7B 在该诊断中正确率为 99.85%。
- 正负掩码:二者都按式 (2) 作用在 T = XQ,不含 XG。M+ 切断 S = Xr̂¯ → XQ,保留所需模态通路;M− 切断 S = Xr̂ → XQ,保留干扰模态通路。
问题中继转向
- 三路并行:同一编码输入经三条共享前 L1 层参数的支路。正支路用 M+,负支路用 M−,原支路保持原掩码。在 L1 得到 H+Q、H−Q、HQ ∈ R^{|XQ|×dh}。
- 更新规则:对每个问题位置 i,∆hi = h+i − h−i。为平衡校正强度与生成稳定性,先把该方向缩放到原状态的 L2 范数再相加:
h̃i = hi + |hi|2 Δ hi / |Δ hi|2, i ∈ XQ 含义是:转向方向来自正负问题状态之差,步长与原状态范数一致。转向后的问题状态与原支路的音视频状态按原 token 顺序拼接,再经剩余 L2 层生成。转向只在 prefill 做;后续自回归使用更新序列的键值缓存。
- 与先前做法的差别:作者称 SECRET 干预的是模态到问题的通路,而不是 Yu et al. (2026)、Zhou et al. (2025) 常用的模态到生成位置通路;对比表征来自内部注意力切断,而不是 Chung et al. (2026)、Jung et al. (2026a) 那种扰动或移除模态输入。
层深与实现选择
- 层范围:Fig. 5(b) 在 CMM 上测试 L1 ∈ {21,…,25},作者称这些层位于主要的模态到问题信息传递阶段之后(层范围选择见 Apdx C.1)。VideoLLaMA2-AV-7B 在 L1 = 21 的 Overall Acc. 为 89.3%,Qwen2.5-Omni-7B 在 L1 = 25 为 86.4%。
- 诊断窗口:§2.4 的对象分数与 ∆Logit 比较集中在第 10–20 层,作者称这是模态到问题干预效应较强的层段。通路切断的默认窗口为七层。
成功判定
- 选择题:CMM 与 AVHBench 报告子集准确率,以及两子集准确率的算术平均 Overall Acc.。
- 开放描述:错配音视频下只描述所要求模态。T-CIDEr 衡量与目标参考的一致(越高越好);D-CIDEr 衡量与干扰参考的重叠(越低表示跨模态泄漏越少);LLM-score 由 GPT-4.1 按目标质量(1–5)减干扰泄漏(0–3)得到,下界为 1。附录 E 给出评判提示词与人工核对协议。
论文做了哪些实验?
三个 AVLLM 上 SECRET 的 Overall Acc. 高于所列训练无关基线,CMM 最高相对基座 +18.0 个百分点。
实验设置
- 被测模型:VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B。作者称三者覆盖不同规模以及 dense 与 mixture-of-experts 架构。诊断 §2.2–§2.4 的主分析使用 Qwen2.5-Omni-7B;附录称对切断窗口与其他 AVLLM 做了稳健性分析。
- 基准规模:AVHBench 的 Video-Driven Audio Hallucination 与 Audio-Driven Video Hallucination,共 3,426 个问答对;CMM 的 Visual Dom. 与 Audio Dom.,共 800 题。开放任务为错配音视频上的 audio-target 与 video-target 描述。
- 基线:VCD(按 MAD 采用四分支音视频扩展)、AVCD、MAD。Qwen3-Omni-30B-A3B 的 Table 1 只报告基座、MAD 与 SECRET。
- 指标:子集准确率及二者算术平均 Overall Acc.;括号内为相对对应基座的绝对百分点增益。描述任务为 T-CIDEr↑、D-CIDEr↓、LLM-score↑。机制指标包括目标答案概率的平均相对变化、Logit Lens 目标物体分数、∆Logit。
- 评审:描述任务的 LLM-score 使用 GPT-4.1。overall score = max(1, target quality − distractor leakage)。人工核对见 Apdx E.4:GPT–human pairwise agreement 为音频目标 89%、视频目标 87%;human–human 为 93% 与 90%。论文未报告该人工样本的对数。所需模态分类与目标物体抽取使用 LLM,附录 B 给出协议。
- 重复次数:论文未报告主结果的重复次数或随机种子。
主结果
Table 1 的准确率(%)如下。Overall Acc. 为两子集准确率的平均;括号为相对该行基座的百分点。
模型与方法 CMM Overall AVHBench Overall VideoLLaMA2-AV-7B 75.9 77.4 + VCD 77.3 70.4 + AVCD 77.9 79.3 + MAD 83.3 79.4 + SECRET 89.3 (+13.4) 81.0 (+3.6) Qwen2.5-Omni-7B 68.4 76.9 + VCD 66.9 73.7 + AVCD 69.5 77.8 + MAD 80.5 81.6 + SECRET 86.4 (+18.0) 84.0 (+7.1) Qwen3-Omni-30B-A3B 79.2 76.8 + MAD 83.6 80.1 + SECRET 87.7 (+8.5) 81.4 (+4.6) 表中超过 8 行是因为三个基座各有多行方法;Qwen3 的 VCD、AVCD 在 Table 1 未报告。子集上,SECRET 相对基座的增益为:VideoLLaMA2 的 CMM Visual/Audio 为 +15.5 / +11.3,AVHBench 音频幻觉/视频幻觉为 +4.9 / +2.3;Qwen2.5-Omni-7B 为 +20.3 / +15.7 与 +9.7 / +4.6;Qwen3-Omni-30B-A3B 为 +4.3 / +12.8 与 +4.1 / +5.0。
- 作者解读:每个骨干上,SECRET 在两个基准的 Overall Acc. 都是所评方法中最高的;相对基座最高 +18.0(CMM)和 +7.1(AVHBench)个百分点,CMM 上的增益更大。作者称这支持由 AVHBench 上的发现推动的问题中继转向具有跨数据集适用性。
- 增益随所需模态变化:作者称 VideoLLaMA2-AV-7B 与 Qwen2.5-Omni-7B 在音频所需任务上提升更大,Qwen3-Omni-30B-A3B 在视频所需任务上获益更多,并认为这可能反映基座能力与跨模态干扰易感性的差异。
- 基线例外:Table 1 中 VCD 相对两个 7B 基座的 AVHBench Overall Acc. 下降(77.4→70.4,76.9→73.7),CMM 上对 Qwen2.5-Omni-7B 也从 68.4 降到 66.9。论文未对这一下降另作解释。
干预设计对比(RQ1)与层深(RQ2)
- 测了什么:Fig. 5(a) 在 CMM 上比较 SECRET、Gen-Interv.(在 XG 构造对比并在同一位置转向)、Removal-Interv.(由移除模态的输入构造对比,仍在问题位置转向)和 w/o Norm(去掉式 (3) 的范数匹配)。模型为 VideoLLaMA2-AV-7B 与 Qwen2.5-Omni-7B。
- 结果:图上标注 Ours 为 89.3 与 86.4。VideoLLaMA2 一侧还标有 86.5、86.4、84.6、81.3、75.9;Qwen2.5 一侧标有 84.7、80.1、75.6、68.4。作者称 SECRET 高于 Gen-Interv. 与 Removal-Interv.,去掉范数匹配也会降低两个模型的准确率。图例与柱的一一对应在纯文本中无法逐柱核对,故不把单个变体写成某一个未在正文点名的数字。
- 层深:Fig. 5(b) 中 VideoLLaMA2-AV-7B 在 L1 = 21 为 89.3%,Qwen2.5-Omni-7B 在 L1 = 25 为 86.4%。Fig. 5(c) 的余弦相似度随深度在前者上升、在后者下降;标注值包括 0.915、0.899、0.896、0.888、0.883、0.872、0.866、0.845、0.836、0.824。作者称两模型的最佳深度都对应最低相似度,并认为更大的正负分离可能提供更有信息量的转向对比。附录 D 另有 PCA 可视化;正文未给出可回查的簇间距离数字。
开放描述与细粒度行为(RQ3、RQ4)
- 描述任务(Table 2):Qwen2.5-Omni-7B 上,SECRET 的音频目标 T-CIDEr/D-CIDEr/LLM-score 为 17.4 / 4.59 / 3.76,视频目标为 31.8 / 2.66 / 4.01;基座为 17.7 / 5.17 / 3.12 与 29.3 / 3.70 / 3.57。VideoLLaMA2-AV-7B 上 SECRET 为 14.4 / 12.8 / 3.57 与 32.4 / 3.20 / 3.79;基座为 13.9 / 20.2 / 2.93 与 32.9 / 5.43 / 3.27。作者称 SECRET 在两个模型和两种描述上 D-CIDEr 最低、LLM-score 最高,T-CIDEr 保持有竞争力。反例:Qwen2.5 音频 T-CIDEr 从 17.7 到 17.4,VideoLLaMA2 视频 T-CIDEr 从 32.9 到 32.4,均低于基座;Gen-Interv. 在若干格上 T-CIDEr 更高(如 VideoLLaMA2 音频 14.8、视频 34.1)。
- 答案边际(Fig. 6(a)):边际为 XG 处正确答案 logit 减去错误候选 logit。作者称 SECRET 相对基座提高了两个骨干的均值和中位数。图中纵轴约从 −2 到 4,纯文本看不到具体均值、中位数,故不写这些数。
- 时长分层(Fig. 6(b)):作者称在 CMM 最常见的视频时长组上准确率增益一致,较长片段上增益仍然大。VideoLLaMA2-AV-7B 在报告的最长组(14–16 秒)达到 14.7 个百分点;图上还标有 +15.5、+14.0、+14.7(10–12 秒、12–14 秒、Overall 等组,纯文本中组别与标注的逐项对应不完整)以及 Qwen2.5-Omni-7B 的 +16.0、+18.5、+13.3、+16.2。
机制诊断中的数字
- 所需模态识别(§2.2):Qwen2.5-Omni-7B 只看问题,将所需证据分为 audio、video 或 ambiguous,正确率 99.85%。作者认为幻觉并不只是没识别所需模态。
- Fig. 3(a):第 10–20 层中,Intervened(切断 Xr̄→XQ)的目标物体分数低于 Original 的样本比例在每一测试层都超过 90%,若干层接近 100%。右图均值在干预后更低。作者认为干扰通路把错误来源线索带入问题状态。
- Fig. 3(b):作者称 Question Cut 在每一测试层的 ∆Logit 都大于 Generation Cut。纵轴约 0 到 0.8,纯文本没有逐层数值。
- Fig. 2:作者称在两种幻觉方向的 source-faithful 样本上,切断 Xr→XQ 带来的目标答案概率下降大于切断 Xr→XG 或 Xr→Xr̄。概率变化率轴约从 0 到 −30(视频驱动)和 0 到 −15(音频驱动),纯文本没有逐层读数。
其他消融与分析
- 范数匹配:去掉后两个 7B 模型在 CMM 上的 Overall Acc. 下降(Fig. 5(a));作者未在正文给出 w/o Norm 的单独精确读数。
- 转向深度 L1:测试 21–25 层;最佳点与正负问题表征余弦相似度最低的深度重合(Fig. 5(b)(c))。
- 通路目标:Question Cut 的 ∆Logit 在第 10–20 层每层都大于 Generation Cut(Fig. 3(b))。
- 人工一致性:音频/视频描述的 GPT–human agreement 为 89% / 87%,human–human 为 93% / 90%(Apdx E.4)。
- Qwen3-Omni-30B-A3B 未报告 VCD 与 AVCD;描述任务与 Fig. 5、Fig. 6 未包含该 30B 模型。
有什么可以进一步探索的点?
作者把局限写在附录 A:分析以是非题为主,开放任务只覆盖两个 7B 模型,且未分析计算开销。
作者指出的局限与后续方向
- 任务形式:附录 A 称机制分析与主评测集中于是非式源指定问题;作者计划在更开放的音视频指令上检验 question relay 是否仍是主要干扰位置。(Appendix A)
- 模型覆盖:附录 A 称模态特定描述只在 VideoLLaMA2-AV-7B 与 Qwen2.5-Omni-7B 上评估;作者计划把开放生成评测扩展到更大或 MoE 的 AVLLM。(Appendix A)
- 计算开销:附录 A 称论文未分析三支路 prefill 的计算开销;作者计划报告相对单次前向的额外开销,并研究能否复用中间状态以降低开销。(Appendix A)
- 后续机制:附录 A 将“干扰线索在问题状态中与所需证据如何分离”列为后续分析方向,而不是已完成的结论。(Appendix A)
若附录 A 的原句与上述条目用词不完全一致,以上四条均对应附录标题 “Discussion, Limitations, and Future Directions” 所承诺的局限与后续方向;正文第 6 节只重述了贡献,没有另列局限。
实验覆盖范围
- 主表模型:Table 1 的被测模型为 VideoLLaMA2-AV-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B。Qwen3 一行只含基座、MAD 与 SECRET。
- 数据规模:AVHBench 两个幻觉子集共 3,426 个问答对;CMM 两个支配子集共 800 题(§4.1)。描述任务的样本条数论文在正文 Table 2 处未给出。
- 诊断模型:§2.2 的 99.85% 与 §2.3–§2.4 的主图针对 Qwen2.5-Omni-7B。附录 B 称另有跨 AVLLM 与切断窗口大小的稳健性分析。
- 防御比较范围:训练无关基线为 VCD、AVCD、MAD。训练时对齐方法在相关工作中被讨论,Table 1 未把它们列为对比行。
- 评审与重复:描述分数的评判模型为 GPT-4.1;Apdx E.4 给出 pairwise agreement,未报告人工对数。主准确率未报告重复次数。
总结一下论文的主要内容
SECRET 在问题状态上做源条件转向,三个 AVLLM 上减轻了跨模态接地幻觉。
SECRET 是一种训练无关的问题状态转向方法,用来减轻 AVLLM 的 source-confused grounding hallucination。
- 问题:当问题指定答案必须来自音频或视频之一时,另一模态的线索仍会进入回答。可见钢琴配上只有人声的音频,模型仍可能回答听到钢琴。作者报告 Qwen2.5-Omni-7B 仅凭问题识别所需模态的正确率为 99.85%,因此把原因追到内部通路而不是“没读懂题目”。
- 机制:问题 token 的隐状态充当中继。切断所需模态到问题 token 的注意力,对原本答对的样本伤害最大;切断干扰模态到问题 token,比切断到生成位置更能抬高正确答案 logit。干扰通路切断后,第 10–20 层里目标物体分数下降的样本比例每层都超过 90%。
- 方法:同一 AVLLM 先预测所需模态,再并行跑三条共享前 L1 层的支路:一条切断干扰模态到问题 token,一条切断所需模态,一条不切断。用正负问题状态之差、并按原状态 L2 范数缩放后加回原状态,只改问题位置,音视频 token 保持原支路,随后层继续生成。
- 结果:Table 1 中,SECRET 在三个模型、CMM 与 AVHBench 的 Overall Acc. 都高于同表的训练无关基线。相对基座,Qwen2.5-Omni-7B 为 +18.0(CMM)和 +7.1(AVHBench)个百分点;VideoLLaMA2-AV-7B 为 +13.4 和 +3.6;Qwen3-Omni-30B-A3B 为 +8.5 和 +4.6。错配输入的描述任务上,SECRET 的 D-CIDEr 最低、LLM-score 最高,部分 T-CIDEr 低于基座或 Gen-Interv.。CMM 上较长视频(14–16 秒)的增益在 VideoLLaMA2-AV-7B 为 14.7 个百分点。
- 作者结论:作者认为问题状态同时中继所需证据与干扰线索,在该中继做源条件转向可以缓解这类幻觉,并迁移到开放的模态特定描述。附录 A 把是非题之外的指令、更大模型上的开放生成,以及三支路开销留作后续工作。