EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
提出危害窗口与区间指标,统一评测分解攻击和提示注入下的智能体滥用监视
摘要统一智能体滥用监视框架,动作视角兼顾两类威胁但危害定位仍存瓶颈。
提出 CRIME 框架,组合良性 Agent 技能诱发恶意行为
CRIME 把公共技能库中各自通过审查的技能配成两两组合,看联合执行能否实现指定恶意任务。。
提出 Persona Guardrail,强制客服智能体守住功能边界
Persona Guardrail 是客服向智能体的同步运行时防御:先写明功能边界,再决定放行或拦截,而不是只检测某一攻击类。
提出收缩约束 SSM 安全头,认证嵌入扰动并检测越狱
给 SSM 安全头一个收缩条件,并在越狱检测上使用收缩正则的 S4 头。。
用分类后缀提升激活探针对分布外恶意输入的检测
用户轮后的分类后缀,被作者用作激活探针的分布外检测干预:排序看格式,低 FPR 精度看是否点名恶意/良性。
提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱
提出 DART,用去噪表征转移检测多轮智能体攻击并注入提醒
提出 CollageAttack,用空间文本碎片重组越狱文生图模型
摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。
评测多轮对话中 GradSafe 越狱检测的可分性与脆弱性
作者评估梯度越狱检测从单条提示词迁到多轮对话后还剩多少可分性,方法是用 Context Window Scanner 把 GradSafe 原封不动地套到用户轮窗口上。
提出免训练框架 SED,将有害智能体轨迹蒸馏为可检索安全策略
构建 TriggerBench 并训练 ThinkingGuard,检测图文隐式风险
这篇工作研究多模态隐式风险检测:图文各自良性,风险只在关键元素与触发元素交互时出现。
诊断护栏相对基座在对抗提示上的置信失校
诊断性分析:五个提示词分类 guard 的置信度,在清洁输入上可以较校准,在越狱包装后则变成高置信度的错误判定。
提出 RISE,迭代演化可复用策略对文生图模型做红队
用能量势垒信号检测扩散语言模型的越狱
Bach 等提出用去噪能量景观解释 masked diffusion 语言模型上的越狱,并由此得到三个免训练检测信号。。
提出 RLCDAlignBench,零样本检测多种对齐失败
RLCDAlignBench 测量用强化学习做校准决策的 Jev,能否当作对齐失败的零样本检测器。
用 CASCADE 在统一威胁模型下筛选跨阶段越狱防御组合
提出 HE-Guardrail,在密文推理中评估越狱护栏并门控回复
把越狱护栏装进同态加密 LLM 推理:服务器不解密,也能按安全决策决定客户端看到目标回复还是拒绝回复。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 HERALD,用跨层有害投影轨迹检测越狱提示
摘要HPD 用跨层投影形状区分有害与良性提示。