EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
另有 201 篇论文还没打上分类标签,暂不在筛选结果里。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出 PackHallu,经规则文件提示注入诱导编码 Agent 换用攻击者指定包
PackHallu 研究一种针对编程智能体规则文件的提示注入:让智能体在本应使用合法依赖时,改导入攻击者指定并控制的包。
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 CORSA,按任务簇优化技能注入的检索与执行
提出 PEV 攻击,在输入嵌入上加高斯噪声越狱开源模型
PEV 是对 open-weight LLM 的 embedding 噪声越狱。
提出 ReSA,从对齐模型行为恢复安全奖励并在解码时反转
ReSA 是一种对抗攻击:从对齐模型的可观察行为恢复代理安全奖励,再在解码时把该奖励反过来用。。
形式化 watchman 防御以阻止序贯马赛克攻击
这篇工作同时给出序贯马赛克防御的博弈理论,以及冻结 LLM 上的分角色自博弈训练。
提出 Red-TTT,在攻击过程中更新攻击者实现自动化越狱
提出推理时上下文注入,用代码注释诱导补全生成含弱点的代码
提出 EviLLM,经账户指令或插件向代码生成流程注入漏洞
提出组合式意图隐藏越狱,按先验后验匹配选择辅助任务
这篇工作把组合式意图隐藏写成任务选择:有害目标必须留在 bundle 里,同时让估计的有害意图概率贴近全集先验,或降到阈值以下。
提出 CodeMimicry,以结构化代码补全诱导模型生成有害内容
提出 A2A-TIBA,经 A2A 对等任务间接注入并植入常驻回调
A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。
提出 SceneJail,利用视频情境上下文越狱视频多模态模型
提出 VirusCascade,劫持推荐智能体协同反思以实现定向推广
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
提出 FinRT,将消费金融自适应红队轨迹蒸馏为可复用对抗提示生成器
FinRT 是面向消费金融的红队框架:先发现政策失效,再训练一个按政策、领域与目标行为出提示的生成器。
提出 RISE,迭代演化可复用策略对文生图模型做红队
提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。
提出残余权限重放攻击,跨任务复用长期 Agent 的历史授权绕过确认