防御arXiv 2609.36121
Render Before Reading:把不可信内容渲染成图像以防御提示注入
提出 Pictionary,将不可信文本渲染成图像以防御提示注入
- arXiv
- 2609.36121
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Opus 4.7、Claude Haiku 4.5、GPT-5.5 等 12 个
提出 Pictionary,将不可信文本渲染成图像以防御提示注入
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。