跳到正文
10月10日 · 周六

全部论文

找到 19 篇

另有 277 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2610.03430

    JIL:通过对抗后缀操纵 LLM 请求调度优先级

    提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级

    发表
    被测模型
    Llama-3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。

    JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。

    深度解读完整解读
  3. 攻击arXiv 2609.02172

    BOSS:以广度优先后缀搜索改进 GCG 越狱优化

    提出广度优先后缀搜索 BOSS,改进 GCG 越狱优化

    发表
    攻击者
    白盒
    被测模型
    Llama-2-7B-Chat、Yi-1.5-9B-Chat、Qwen2-7B-Instruct 等 8 个
    摘要BOSS 把 GCG 类优化从单条深搜索改为多条短轨迹加源侧诊断。

    BOSS 是插在 GCG 类离散 suffix 优化上的搜索框架:局部梯度更新不变,变的是固定预算花在深度还是广度。

    深度解读完整解读
  4. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作

    发表
    被测模型
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  5. 攻击arXiv 2608.07430

    研究者提出 SN-Guided Diffusion,利用扩散大模型安全神经元实现离线越狱

    提出 SN-Guided Diffusion,利用安全神经元实现离线越狱

    发表
    攻击者
    黑盒、白盒
    被测模型
    Qwen2.5-7B-Instruct、LLaDA-8B-Instruct、Dream-Instruct-7B 等 15 个
    摘要论文揭示了扩散语言模型对自回归安全神经元的继承性,并提出纯离线黑盒越狱框架 SN-Guided Diffusion。

    论文系统评估了扩散大语言模型(DLLM)在安全对齐中的双重角色——既作为白盒攻击目标,又作为黑盒越狱生成的对抗工具。

    深度解读完整解读
  6. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    被测模型
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 6 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  7. 评测与基准arXiv 2607.19855

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    提出最小范数攻击集成,用鲁棒性曲线评测图像分类器

    发表
    被测模型
    C1–C20(CIFAR-10,Table 1)、I1–I10(ImageNet,Table 1)
    摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。

    这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。

    深度解读完整解读
  8. 攻击arXiv 2605.21541

    研究者提出 FRA-Attack 频域正则化方法,提升对闭源 MLLM 的迁移攻击效果

    提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击

    发表
    攻击者
    黑盒
    被测模型
    GPT-5.2、GPT-5.4、Claude-Opus-4.6 等 15 个
    摘要FRA-Attack 以频域对齐和梯度低通做可迁移定向攻击,闭源面板上作者称整体更强,Gemma 除外。

    FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。

    深度解读完整解读
  9. 攻击arXiv 2604.14604

    AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入

    提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入

    发表
    被测模型
    SpeechGPT、GLM-4-Voice、VITA-Audio 等 15 个

    摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。

    深度解读完整解读
已经到底了