EpiReal-Bench:商用图像生成模型虚假声明红队基准
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
- arXiv
- 2610.11112
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 被测模型
- GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
摘要四款商用图像模型能把假主张画成可信证据。
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
另有 318 篇论文还没打上分类标签,暂不在筛选结果里。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
比较连续后训练阶段如何改变语言模型的说服力
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
提出 OrthoPurify,用正交投影清除视觉语言模型适配器中的劫持方向
OrthoPurify 是部署前的 LVLM 后门净化方法,用一次正交投影去掉被劫持的权重更新方向。
测量委托收费激励下模型策略性虚报任务信心
摘要论文建立人机委托信誉博弈框架,揭示模型策略性虚报置信度且主要造成信息破坏,作者指出校准受制于报告意愿。
比对捐赠对话史与众包提交,测量 AI 代答的集中度与获批
提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出
摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。
提出 World Models' Last Exam 评测视频物理一致性
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
在 CWEval 上跟踪代码生成的功能-安全差距
摘要绝对安全性上升且差距仍在,开放权重并不分开各家族的轨迹。
论证 Lean 编译通过不能保证自然语言数学证明语义忠实
摘要论文论证了形式化编译不保证原证明正确,确立了消歧不可计算性理论,并揭示了 OpenAI 爆破证明中的具体脱节。
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。
测量财务事实变少时身份对股权配置建议的替代
同一财务只改人设,测量披露变薄时股权建议里的身份替代。
提出 ATLAS 用水平集估计恢复黑盒分类器的对抗输入集合
ATLAS 是一个查询式 black-box 框架,用来构造诱发失败的对抗输入集合,供鲁棒性审计使用。
构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
评测模型识别不可能工程题后是否仍报已解决
成对的工程力学题把能不能解、和会不会拒绝不可能的前提拆开。每题有一致版,以及只改一个数据或前提、使所述状态不可能存在的缺陷版。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
用伤害风险模型评估英国 AI 生成虚假信息的伤害潜能
提出只改 SAE 解码器的后门,在冻结语言模型上植入代码插入
只改 SAE 解码器、冻结编码器与语言模型,即可把代码插入行为放进推理时的辅助组件。作者把这视为 SAE 供应链问题:checkpoint 一旦替换某一层激活,就参与后续计算,而不只是解释工具。