跳到正文
10月10日 · 周六

全部论文

找到 56 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.11112

    EpiReal-Bench:商用图像生成模型虚假声明红队基准

    构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Nano Banana 2、Grok Imagen 2.0 等 4 个
    摘要四款商用图像模型能把假主张画成可信证据。

    EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。

    深度解读完整解读
  2. 攻击arXiv 2610.09819

    FAB 攻击:给 HuBERT/WavLM 植入后门,背景警笛声即可让下游语音任务失灵

    提出 FAB 攻击,向声学基础模型植入可由环境声触发的后门

    发表
    被测模型
    HuBERT-base、WavLM-base

    摘要论文提出了针对声学基模的 FAB 后门攻击,在弱威胁模型下实现了任务无关、物理可触发的后门植入。

    深度解读完整解读
  3. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  4. 攻击arXiv 2610.05601

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    提出 TRACER,从权重差识别扩散模型被擦除概念

    发表
    攻击者
    白盒
    被测模型
    Stable Diffusion v1.5、Stable Diffusion 3、FLUX.1 等 5 个
    摘要TRACER 用权重足迹识别未披露擦除概念并估计个数,作者称数秒内完成且准确率高于对照。

    TRACER 针对的是遗忘扩散模型上的目标识别:提供者从公开基座 W 用已发表方法擦掉未知集合 S⋆,只发布 W′。攻击者还有假定包含这些概念的词表,但不知擦了谁、擦了几个、用了什么算法。

    深度解读完整解读
  5. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读
  6. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    被测模型
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  7. 攻击arXiv 2609.35699

    论文:蒸馏防御在蒸馏后强化学习下易被攻破

    提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 12 个
    摘要更现实的蒸馏攻击是蒸馏后再 RL。

    这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。

    深度解读完整解读
  8. 攻击arXiv 2609.15989

    研究者提出 plan injection 攻击,可绕过思维链监控

    提出 plan injection 攻击,植入良性伪装计划以绕过思维链监视器

    发表
    攻击者
    灰盒
    被测模型
    Qwen2.5-Coder-7B-Instruct、Qwen3-8B、DeepSeek-R1-0528 等 6 个

    摘要论文指出模型会将外部上下文中的伪装计划改写为自身推理,使思维链监视器失效甚至反向合理化恶意行为。

    深度解读完整解读
  9. 攻击arXiv 2609.09553

    研究:任意密文攻击前沿大模型无需微调即可越狱

    提出任意字母置换密码越狱,无需微调即可诱导有害输出

    发表
    攻击者
    黑盒
    被测模型
    Claude Sonnet 4、Claude Sonnet 4.5、Gemini 3 Flash (preview) 等 7 个

    摘要前沿大模型无需微调即可通过提示词学会字母置换密码,进而绕过分类器与对齐,作者呼吁关注能力提升带来的安全风险。

    深度解读完整解读
  10. 攻击arXiv 2609.08186

    论文揭示大推理模型的对齐崩溃并提出 Reasoning Trap 越狱范式

    揭示推理加深引发的对齐坍塌,用 Reasoning Trap 放大越狱

    发表
    被测模型
    Qwen3-8B、Qwen3-14B、Llama2-7B 等 8 个
    摘要更深推理提升题目准确率,同时提高扰动下的相对损失。

    作者研究扩展推理是否以对齐稳健性为代价,提出 ALR、RT 与 RRA。。

    深度解读完整解读