攻击arXiv 2608.27531
MAMJ:面向视觉语言模型的元自适应多模态越狱攻击
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
- arXiv
- 2608.27531
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- GPT-4o、Gemini-3-Pro-Preview、Seed 2.0 等 4 个
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
系统分析 AP2 支付协议的授权安全并验证前置上下文操纵
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出条件触发的爆炸提示词,延迟激活 Agent 的间接提示注入
论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。