论文提出 DSR 跨模态越狱框架:用良性输入诱导 MLLM 有害输出
Benign Inputs, Harmful Outputs: Cross-Modal Jailbreaking via Distributed Semantic Recomposition
AI 导读
论文提出 Distributed Semantic Recomposition(DSR)跨模态越狱框架,将有害意图分解为一组良性的文本与视觉原语,借助模型的推理能力在跨模态推理阶段把这些看似无害的组件融合成有害输出。作者称,此前单模态文本攻击和跨模态越狱通常在输入端就包含部分显式有害或敏感内容(即 Harm-Bearing),容易被安全过滤器检测拦截,而 DSR 在多个商用 MLLM 流水线上取得更高攻击成功率,同时输入毒性率极低甚至可忽略。论文据此提出 MLLM 中的 Utility-Safety Paradox,即模型的指令遵循能力反而助长了对自身的认知利用。