事件持续更新
论文提出将不可信内容渲染为图像以防御提示注入
先了解这件事
AI 综述
2026-09-29,一篇 arXiv 论文(作者包括 Nicholas Carlini、Florian Tramèr、Xingjun Ma 等)提出名为 Pictionary 的防御方法,用于抵御针对多模态大语言模型的提示注入。论文发现,多模态大语言模型对以文本形式出现的对抗指令,比对通过图像等非文本通道呈现的同一指令更易服从。基于这一模态差异,作者提出无需训练的防御思路:在不可信内容进入模型之前,先将其渲染为排版图像或音频,从而降低模型执行其中隐藏指令的可能。2026-10-02,共同作者 Florian Tramèr 在 X 上回应称,该项目由 @JieZhang_ETH 提出,他当时开玩笑说能判断这想法来自对方而非 LLM,因为其足够古怪,并称这种偏离常规的尝试在当下尤为重要。
AI 根据报道生成 · 1 小时前更新
最新进展10月2日 02:13
共同作者 Florian Tramèr 在 X 上称该想法由 @JieZhang_ETH 提出,并称赞其古怪而偏离常规。事件进展
2 个进展
- 10月2日 02:13 · 1 篇报道张杰谈VLM提示注入防御思路
- 9月29日 02:54 · 1 篇报道论文提出将不可信内容渲染为图像以防御提示注入
后续时间线
10月2日
- X @florian_tramer张杰谈VLM提示注入防御思路
当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。
- X@JieZhang_ETH· 讨论Pictionary作者讨论将不可信文本渲染为图片的提示注入防御(新标签页打开原帖)
9月29日
- arXivRender Before Reading:把不可信内容渲染成图像以防御提示注入
论文发现多模态大语言模型对以文本形式出现的对抗指令比对图像等非文本通道的同一指令更易服从,并将这一模态差异转化为无需训练的防御方法 Pictionary:在不可信内容进入模型前先渲染为排版图像或音频。
相关讨论
共 1 条
- X@JieZhang_ETH · Jie ZhangPictionary作者讨论将不可信文本渲染为图片的提示注入防御(新标签页打开原帖)
“We know VLMs mostly learn instruction-following from text, so for them an image is something to describe, not obey.”
关注度走势
每天新增来源
- 9月29日 新增 1 个来源(1 家媒体、0 个账号)
- 9月30日 新增 0 个来源(0 家媒体、0 个账号)
- 10月1日 新增 0 个来源(0 家媒体、0 个账号)
- 10月2日 新增 2 个来源(1 家媒体、1 个账号)
- 10月3日 新增 0 个来源(0 家媒体、0 个账号)
每小时关注度
趋势只比较一直被完整观测到的同一批信源,范围可能比当前关注度小。移动指针或点击图表查看每小时关注度;键盘可用左右方向键切换。