跳到正文
10月10日 · 周六

全部论文

找到 20 篇

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  2. 攻击arXiv 2610.05894

    研究者提出闭环偏见注入攻击

    提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见

    发表
    攻击者
    灰盒
    被测模型
    LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct

    摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。

    深度解读完整解读
  3. 攻击arXiv 2610.04985

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    评估应用决策层的输入注入与隐私推断风险

    发表
    攻击者
    黑盒、灰盒
    被测模型
    Jev、NanoJev
    摘要Jev 的类型化决策可被输入与训练操纵,也会泄露信息,并同时支持检测与滥用。

    Jev 是 TypeSafe 的 System One 模型,把应用 state 和固定问题变成 Choice、Noul 或 Score 的类型化决策与概率。作者用官方 API 和可改训练的 NanoJev,考察它作为决策层时的操纵、泄露与双重用途。

    深度解读完整解读
  4. 攻击arXiv 2610.03430

    JIL:通过对抗后缀操纵 LLM 请求调度优先级

    提出 JIL 对抗后缀,压低长度预测以抬高请求调度优先级

    发表
    被测模型
    Llama-3-8B-Instruct、Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3 等 4 个
    摘要JIL 用对抗后缀压低长度预测,在预测式 LLM 调度中提高自身优先级。

    JIL 是对预测式 LLM 调度的攻击:用对抗后缀压低长度预测,使请求在 SRPT 式队列里更早得到服务。

    深度解读完整解读
  5. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作

    发表
    被测模型
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  6. 评测与基准arXiv 2607.19855

    研究者提出最小范数攻击集成,用鲁棒性曲线替代单一 ε 评测

    提出最小范数攻击集成,用鲁棒性曲线评测图像分类器

    发表
    被测模型
    C1–C20(CIFAR-10,Table 1)、I1–I10(ImageNet,Table 1)
    摘要预算可控的最小范数集成用 AOI 逼近攻击前沿,DOI 给出不依赖单一ε的防御排序。

    这篇工作把对抗鲁棒评测从单一 ε、固定集成,改成可按查询预算收紧的曲线估计。

    深度解读完整解读
  7. 攻击arXiv 2607.14493

    LogInject 框架披露 LLM 日志分析中的被动提示注入

    提出 LogInject 框架,评测日志分析中的被动提示注入及缓解

    发表
    被测模型
    GPT-4o、Claude 3.5 Sonnet、Llama-3-70B-Instruct

    摘要论文评估了 LLM 日志分析中的上下文污染风险,提出分片拼接等攻击与三层防御,指出必须结合架构隔离与人工介入。

    深度解读完整解读
  8. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
  9. 攻击arXiv 2606.11265

    论文提出 CRCP 投毒框架,揭示 RAG 分块与重排序下的投毒失效问题

    提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒

    发表
    被测模型
    GPT-4o、DeepSeek-R1、Qwen3-Max 等 11 个
    摘要CRCP 把投毒做成多阶段一致性问题。

    CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。

    深度解读完整解读
  10. 攻击arXiv 2606.09499

    研究者提出针对世界模型的机器人学习管线投毒攻击

    提出 VPH 与 VTH,只改视频帧劫持世界模型并投毒下游策略

    发表
    被测模型
    Cosmos-Predict 2.5、Cosmos-Predict 2.5 AC、Dino WM 等 4 个
    摘要只改视频帧经世界模型投毒。

    只改看似安全的视频帧,经世界模型之后才改变下游机器人策略。 问题在于世界模型进入数据生成后,数据集检查看到的仍是安全演示,合成轨迹却可以变危险。

    深度解读完整解读
  11. 攻击arXiv 2605.21541

    研究者提出 FRA-Attack 频域正则化方法,提升对闭源 MLLM 的迁移攻击效果

    提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击

    发表
    攻击者
    黑盒
    被测模型
    GPT-5.2、GPT-5.4、Claude-Opus-4.6 等 15 个
    摘要FRA-Attack 以频域对齐和梯度低通做可迁移定向攻击,闭源面板上作者称整体更强,Gemma 除外。

    FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。

    深度解读完整解读
  12. 攻击arXiv 2604.14604

    AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入

    提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入

    发表
    被测模型
    SpeechGPT、GLM-4-Voice、VITA-Audio 等 15 个

    摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。

    深度解读完整解读
已经到底了