跳到正文
10月10日 · 周六

全部论文

找到 20 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2609.02172

    BOSS:以广度优先后缀搜索改进 GCG 越狱优化

    提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Yi-1.5-9B-Chat、Qwen2-7B-Instruct 等 8 个
    摘要BOSS 把 GCG 类优化从单条深搜索改为多条短轨迹加源侧诊断。

    BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。

    深度解读完整解读
  3. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    被测模型
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 13 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  4. 攻击arXiv 2608.07430

    研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱

    提出 SN-Guided Diffusion,利用安全神经元实现离线越狱

    发表
    攻击者
    黑盒、白盒
    被测模型
    Qwen2.5-7B-Instruct、LLaDA-8B-Instruct、Dream-Instruct-7B 等 15 个
    摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。

    论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。

    深度解读完整解读
  5. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 6 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  6. 攻击arXiv 2605.07399

    研究者提出 GPO-V,用全局概率优化越狱扩散视觉语言模型

    提出 GPO-V,用全局概率优化的视觉扰动越狱扩散视觉语言模型

    发表
    攻击者
    白盒、黑盒
    被测模型
    LLaDA-V、LaViDA
    摘要作者用视觉扰动改 dVLM 的全局生成概率,以绕过两类拒绝。

    GPO-V 把越狱从“开头必须顺从”改成“整段去噪概率朝肯定方向走”。。

    深度解读完整解读
  7. 攻击arXiv 2604.24983

    PEO:直接优化原始提示词嵌入的 LLM 白盒越狱方法

    提出 PEO,直接优化原提示词嵌入实现白盒越狱

    发表
    攻击者
    白盒
    被测模型
    Vicuna-7B-v1.3、Llama-2-7B-Chat、Qwen3-4B-Instruct 等 4 个
    摘要PEO 原位优化提示词嵌入、多轮只重攻失败样本。

    PEO是一种不追加对抗 token 的 white-box 越狱:直接改已有提示词嵌入,并只对未成功样本更换续写目标再优化。

    深度解读完整解读
  8. 攻击arXiv 2604.14604

    AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入

    提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入

    发表
    被测模型
    SpeechGPT、GLM-4-Voice、VITA-Audio 等 15 个

    摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。

    深度解读完整解读
  9. 攻击arXiv 2510.10271

    MetaBreak:通过特殊 token 操纵越狱在线 LLM 服务

    提出 MetaBreak,用特殊 token 操纵越狱在线 LLM 服务并绕过审核

    发表
    攻击者
    黑盒
    被测模型
    Llama-3.3-70B-Instruct、Qwen-2.5-72B-Instruct、Gemma-2-27B-Instruct 等 10 个

    摘要利用特殊 token 注入对抗平台模板包裹与审核,多场景验证了越狱有效性与互补性。

    深度解读完整解读
  10. 攻击arXiv 2501.16534

    研究者提出提取对齐 LLM 安全分类器的越狱攻击方法

    提出提取对齐 LLM 内嵌安全分类器并攻击其代理的越狱方法

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7b-chat、Qwen2.5-7B-Instruct、gemma-7b-it 等 7 个
    摘要抽出 safety classifier 近似再攻击迁移。

    作者提出一种白盒越狱做法:抽出对齐 LLM 内部 safety classifier 的近似,再攻击该近似并迁回原模型。

    深度解读完整解读
已经到底了