跳到正文
事件持续更新

论文提出将不可信内容渲染为图像以防御提示注入

2 篇报道2 个报道来源23 小时前更新

先了解这件事

AI 综述

2026-09-29,一篇 arXiv 论文(作者包括 Nicholas Carlini、Florian Tramèr、Xingjun Ma 等)提出名为 Pictionary 的防御方法,用于抵御针对多模态大语言模型的提示注入。论文发现,多模态大语言模型对以文本形式出现的对抗指令,比对通过图像等非文本通道呈现的同一指令更易服从。基于这一模态差异,作者提出无需训练的防御思路:在不可信内容进入模型之前,先将其渲染为排版图像或音频,从而降低模型执行其中隐藏指令的可能。2026-10-02,共同作者 Florian Tramèr 在 X 上回应称,该项目由 @JieZhang_ETH 提出,他当时开玩笑说能判断这想法来自对方而非 LLM,因为其足够古怪,并称这种偏离常规的尝试在当下尤为重要。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月2日 02:13 · 1 篇报道
    张杰谈VLM提示注入防御思路
    X @florian_tramer:张杰谈VLM提示注入防御思路
  2. 9月29日 02:54 · 1 篇报道
    论文提出将不可信内容渲染为图像以防御提示注入
    arXiv:Render Before Reading:把不可信内容渲染成图像以防御提示注入

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月2日
  1. X @florian_tramer
    张杰谈VLM提示注入防御思路

    当 @JieZhang_ETH 提出这个项目时,我开玩笑说我知道这想法来自他而不是 LLM,因为它太古怪了。 我这是赞美! 当我们被 AI 垃圾研究淹没时,偏离常规、尝试古怪的东西比以往任何时候都更重要。

9月29日
  1. arXiv
    Render Before Reading:把不可信内容渲染成图像以防御提示注入

    论文发现多模态大语言模型对以文本形式出现的对抗指令比对图像等非文本通道的同一指令更易服从,并将这一模态差异转化为无需训练的防御方法 Pictionary:在不可信内容进入模型前先渲染为排版图像或音频。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。72 小时的讨论链接数还含 1 篇报道,见后续时间线。

共 1 条

关注度走势

关注度会随讨论变化:新来源越多越新越高,讨论停了回落到初评。

每天新增来源

5 天共 3 个·最多 2(10月2日)·今天 0

  • 9月29日 新增 1 个来源(1 家媒体、0 个账号)
  • 9月30日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月1日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月2日 新增 2 个来源(1 家媒体、1 个账号)
  • 10月3日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

当前关注度 33·可比范围峰值 42(10月2日 03:00)·近 24 小时可比范围变化 +13%

02040609月30日01:0010月1日01:0010月2日00:0010月3日00:00

趋势只比较一直被完整观测到的同一批信源,范围可能比当前关注度小。移动指针或点击图表查看每小时关注度;键盘可用左右方向键切换。