跳到正文
原文
arXiv· arXiv:2609.00206· Ruotong Wang·· 2026-09-01

论文提出分布式隐式危害 DIH,评测 30 多个 MLLM 的视频审核盲区

Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation

AI 导读

论文提出多模态大语言模型在视频审核中的组合式安全盲区,称为分布式隐式危害(DIH),即由视频各组件之间的关系而非单一显式线索产生的危害。作者研究两类代表性情形:跨视觉片段的时间分布危害(DIH-T)与音视频流之间的跨模态危害(DIH-M)。为获得这类难以采集的数据,作者构建多智能体合成框架,把单独无害的组件组合成有害场景并生成带显式推理标注的多样化 DIH 视频,形成超过 9000 条视频的数据集,覆盖纯视觉与音视频两种设置。对 30 多个 MLLM(含前沿闭源模型与领先开源系统)的评测显示,模型在检测 DIH-T 和 DIH-M 上存在明显且一致的缺陷,即使最强的前沿模型也常能正确判断单个组件,却无法识别组合后涌现的有害含义。

阅读原文arxiv.org