跳到正文
10月10日 · 周六

全部论文

找到 15 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  3. 攻击arXiv 2609.35912

    MMSkillRisk:多模态技能图像中的隐藏指令可诱导 Agent 执行未授权操作

    提出 MMSkillRisk 基准,评测多模态技能图像中的隐藏指令诱导 Agent 越权操作

    发表
    被测模型
    GPT-5.6-sol、Kimi-K2.6、Kimi-K3 等 6 个

    摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。

    深度解读完整解读
  4. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  5. 攻击arXiv 2609.04533

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出 Repeat-After-Me 自适应视觉提示注入,诱导 VLM 智能体执行指定任务

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 6 个

    摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    深度解读完整解读
  6. 攻击arXiv 2609.01723

    研究者提出针对微调 TTS 模型的黑盒成员推断攻击

    提出针对微调 TTS 的黑盒成员推断攻击

    发表
    攻击者
    黑盒
    被测模型
    CosyVoice2、F5-TTS、XTTS-v2
    摘要黑盒 TTS 成员推断以 recitation 加分层语音表示为分数,说话人级强于记录级,DP-SGD 可压到随机附近。

    作者给出一个针对微调文本转语音模型的黑盒成员推断框架,分别审计说话人是否进入微调集,以及某一条文本–音频记录是否进入微调集。微调 TTS 以合成文本和参考语音双条件生成,既有生成模型 MIA 的单条件查询和图像/文本上的逐点比较不能直接套用。作者用 scorable extent 与 memorization elicitation 比较五种查询,认为只有 recitation(用目标转写和干净目标语音要求模型复现)同时满足两条,并把它作为主查询。

    深度解读完整解读
  7. 攻击arXiv 2609.01023

    Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

    提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链

    发表
    被测模型
    Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个

    摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。

    深度解读完整解读
  8. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
  9. 攻击arXiv 2604.14604

    AudioHijack 框架对 13 个语音大模型实现隐蔽音频提示注入

    提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入

    发表
    被测模型
    SpeechGPT、GLM-4-Voice、VITA-Audio 等 15 个

    摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。

    深度解读完整解读
  10. 攻击arXiv 2602.15927

    研究者提出面向多轮对话的视觉记忆注入攻击 VMI

    提出 VMI,用扰动图像在多轮对话中潜伏并仅在触发话题输出预定消息

    发表
    被测模型
    Qwen2.5-VL-7B-Instruct、Qwen3-VL-8B-Instruct、LLaVA-OneVision-1.5-8B-Instruct 等 5 个
    摘要VMI 让扰动图像在多轮 LVLM 中潜伏,作者称触发话题出现后仍可输出预定消息。

    VMI 是面向多轮 LVLM 的定向图像攻击:第三方发布带小扰动的图像,良性用户把它当作普通输入。

    深度解读完整解读
  11. 攻击arXiv 2505.11717

    WebInject:通过网页像素扰动对多模态网页 Agent 实施提示注入

    提出 WebInject,用网页像素扰动诱导网页 Agent 执行指定动作

    发表
    场景
    web agent
    被测模型
    UI-TARS-7B-SFT、Phi-4-multimodal-instruct、Llama-3.2-11B-Vision-Instruct 等 5 个
    摘要WebInject 经源码扰动原始像素。

    WebInject 是对 MLLM 网页智能体的环境提示注入:修改网页源码,使原始像素上的扰动经过显示器映射后,诱导智能体执行攻击者指定动作。

    深度解读完整解读
  12. 攻击arXiv 2406.12814

    论文提出 ARE 框架,在 VisualWebArena 上评估多模态 Agent 的对抗鲁棒性

    提出 ARE 框架与图像文本攻击,评测多模态网页 Agent 的对抗鲁棒性

    发表
    场景
    web agent
    被测模型
    GPT-4o、GPT-4V、Claude-3-Opus 等 4 个

    摘要系统评估多模态网页智能体的脆弱性,指出推理时计算组件被攻破会加剧系统风险。

    深度解读完整解读
已经到底了