防御arXiv 2609.36121
Render Before Reading:把不可信内容渲染成图像以防御提示注入
提出 Pictionary,将不可信文本渲染成图像以防御提示注入
- arXiv
- 2609.36121
- 发表
- 层
- 应用层
- 场景
- AI Agent
- 被测模型
- Claude Opus 4.7、Claude Haiku 4.5、GPT-5.5 等 12 个
提出 Pictionary,将不可信文本渲染成图像以防御提示注入
提出 Auto Mode ++,加固编码 Agent 阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
用后验重加权解释多模态上下文越狱,并提出风险门控的良性示例注入防御
Zhang 等把多模态 ICL 越狱写成对齐模型在安全与有害隐模式之间的推理时后验漂移,并据此做风险门控防御。