攻击arXiv 2601.05339·1月9日多模态大语言模型的多轮越狱攻击与 FragGuard 防御提出多轮多模态越狱,并用 FragGuard 拦截有害响应arXiv2601.05339发表1月9日层提示层场景模型与 API攻击者黑盒被测模型LLaVa-1.6 (7B)、LLaVa-1.6 (13B)、Qwen-2-7B 等 5 个防御检测与过滤攻击越狱技术多轮渐进组件视觉+2+2深度解读完整解读