跳到正文
原文
arXiv· arXiv:2609.36121· Jie Zhang·· 3 天前

Render Before Reading:把不可信内容渲染成图像以防御提示注入

Render Before Reading: Visual Rendering as a Prompt Injection Defense

AI 导读

论文发现多模态大语言模型对以文本形式出现的对抗指令比对图像等非文本通道的同一指令更易服从,并将这一模态差异转化为无需训练的防御方法 Pictionary:在不可信内容进入模型前先渲染为排版图像或音频。

阅读原文arxiv.org