防御arXiv 2609.36121
Render Before Reading:把不可信内容渲染成图像以防御提示注入
提出 Pictionary,将不可信文本渲染为图像以防御提示注入
- arXiv
- 2609.36121
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 测试
- Claude Opus 4.7、Claude Haiku 4.5、GPT-5.5 等 12 个
提出 Pictionary,将不可信文本渲染为图像以防御提示注入
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。