跳到正文
10月9日 · 周五

全部论文

找到 140 篇

另有 550 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  2. 攻击arXiv 2607.21619

    ASO:用GRPO优化视觉风格放大MLLM越狱攻击

    提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击

    发表
    攻击者
    灰盒
    被测模型
    GPT-4.1-mini、Gemini-2.5-Flash、Qwen3-VL 等 6 个

    摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。

    深度解读完整解读
  3. 评测与基准arXiv 2602.08877

    自动红队流水线压测对齐审计,发现提示词级策略性欺骗可致审计失效

    提出自动化红队流水线,用系统提示词压测对齐审计能否抵御策略性欺骗

    发表
    被测模型
    Gemma 2 9B Instruct、Llama 3.3 70B Instruct

    摘要通过红队提示词揭示现有审计方法易受策略欺骗,并在激活层面诱导高置信度错误推断。

    深度解读完整解读
  4. 评测与基准arXiv 2610.07939

    CCDF 数据集:Grok Imagine、Veo 3.1、Sora 2 伪造监控录像,十个深伪检测器基本认不出

    提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别

    发表
    被测模型
    C2P-CLIP、ForgeLens、D3-Im 等 10 个

    摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。

    深度解读完整解读
  5. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉安全分,发现偏离主要来自场景模板与视角

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  6. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  7. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  8. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  9. Sleight-Bench:40 条攻击中 20 条从未被 Opus 4.6 监控发现

    构建 SLEIGHT-BENCH,评测代码智能体监控器的概念盲点

    发表
    被测模型
    Claude Opus 4.6、Claude Opus 4.7、Claude Sonnet 4.6 等 6 个

    摘要评估针对监控盲点的规避基准,发现前沿监控器漏报率高,算力与脚手架虽有提升但存在类别局限。

    深度解读完整解读
  10. 防御arXiv 2610.07774收录

    研究者提出读取路由 logits 的 MoE 视觉语言模型多模态安全检测器

    AI 导读研究者提出一种轻量级路由 logits 安全检测器,在提示词预填充阶段读取 MoE 视觉语言模型的专家路由信号,在生成前判断多模态请求是否安全,且不修改模型参数或专家路由。

    收录
    被测模型
    Qwen3-VL-30B-A3B-Instruct、Kimi-VL-A3B-Instruct
    摘要读出而非操纵 router logits,可在不改模型的情况下降低两模型的组合式安全错误。

    作者在两个指令微调 MoE VLM 上比较改模型与读路由。组合式风险按 HoliSafe 分成五类:图文各自可安全,合在一起才不安全,或不安全内容只在图像里。

    深度解读完整解读
  11. 评测与基准arXiv 2610.06898

    DIBench:面向移动 GUI 智能体多候选选择决策完整性的安全基准

    提出 DIBench,评测界面注入对移动智能体选择决策的操纵

    发表
    被测模型
    Qwen2.5-VL(32B)、Qwen3-VL(32B)、GUI-Owl(32B) 等 7 个

    摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。

    深度解读完整解读
  12. 评测与基准arXiv 2610.04737

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    提出 PyINE 基准,训练捷径跟随模型并比较监督者

    发表
    被测模型
    shortcut-following model organism、gpt-4o、gpt-5 等 12 个
    摘要PyINE 用可验证代码执行研究捷径失败的监督覆盖与成本权衡。

    PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。

    深度解读完整解读
  13. 防御arXiv 2610.06001

    AgentSpy:在系统调用层观测 AI Agent 行为并检测技能注入攻击

    提出 AgentSpy,在系统调用层观测 Agent 并检测技能注入

    发表
    被测模型
    gpt-5.6-terra、deepseek-v4-flash、glm-5.3-flash 等 4 个
    摘要提出了系统级智能体监控框架 AgentSpy,揭示出通过测试背后的非预期行为与注入风险。

    本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。

    深度解读完整解读
  14. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读