跳到正文
原文
论文追踪· arXiv:2603.09246· Quanchen Zou, Moyang Chen, Zonghao Ying, Wenzhuo Xu, Yisong Xiao, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang·本站收录 · 原文发表

研究者提出 Reasoning-Oriented Programming,通过链式语义片段越狱大型视觉语言模型

Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models

AI 导读

研究者提出一种名为 Reasoning-Oriented Programming 的攻击范式,将越狱类比为系统安全中的 Return-Oriented Programming,利用模型的指令跟随能力把多个语义正交的良性输入组合起来,使有害逻辑只在推理后期才浮现,从而绕过感知层面的安全对齐。作者称现有防御主要针对输入中显式的恶意模式,忽视了组合推理带来的漏洞。该框架通过优化语义正交性和空间隔离生成视觉片段,在 SafeBench 和 MM-SafetyBench 上对包括 GPT-4o 和 Claude 3.7 Sonnet 在内的 7 个大型视觉语言模型进行评测,结果显示其持续绕过安全对齐,在开源模型上平均超过最强基线 4.67%,在商业模型上平均超过 9.50%。

阅读原文arxiv.org