跳到正文
10月9日 · 周五

全部论文

论文 1414 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 450 篇还没打标签,不在筛选结果里。
  1. 评测与基准arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  2. arXiv 2610.11634收录

    LTBD:用可学习信任边界分隔符防御提示注入

    AI 导读论文提出可学习信任边界分隔符(LTBD),一种在输入中显式编码信任边界、不改变 LLM 参数的轻量防御方法,用少量可学习分隔符区分可信用户指令与不可信外部数据,使模型更好遵循预期的信任层级。

    收录