ASO:用GRPO优化视觉风格放大MLLM越狱攻击
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
- arXiv
- 2607.21619
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 灰盒
- 测试
- GPT-4.1-mini、Gemini-2.5-Flash、Qwen3-VL 等 6 个
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
另有 51 篇论文还没打上分类标签,暂不在筛选结果里。
提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击
摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。
提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗
摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。
提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
评测人类开发者在协作编程中能否发现编码 Agent 的隐蔽破坏
提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出路径对齐归因 PAA,在边界动作前审计长流程智能体的分段提示注入
本研究针对长流程智能体在执行任务时面临的分阶段间接提示注入威胁,提出了在动作生效前进行拦截的边界动作审计框架与路径对齐归因方法。
提出 MAMJ,在元层面交替优化多模态越狱的策略提示与攻击者权重
提出 HACA,将图文越狱拆为原子策略并自动组合以诱导有害输出
用演化算法构造思维病毒并测量其在多智能体中的传播
提出 Auto Mode ++,加固编码 Agent 的阻断监视器
摘要系统评估生产阻断监视器在面对持续恶意智能体时的表现,提出加固防御并指明多上下文防御挑战。
综述视觉内容全生命周期中的所有者侧对抗防护方法
Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
组织 ArGuard 共享任务评测阿拉伯语表情包与提示词有害检测
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。