跳到正文
10月10日 · 周六

全部论文

找到 30 篇

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作

    发表
    场景
    web agent
    被测模型
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  2. 攻击arXiv 2610.09027

    P-VMI:对抗图像经 KV cache 持续影响多轮对话

    提出持久视觉记忆注入,使对抗图像经缓存在触发时操控输出

    发表
    被测模型
    Qwen3-8B、Qwen3-VL-8B-Instruct、Gemma-4-12B

    摘要论文提出 P-VMI,证实对抗输入被掩蔽后仍可经 KV 缓存持久控制模型,强调了保留状态的安全风险。

    深度解读完整解读
  3. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  4. 攻击arXiv 2609.04533

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出 Repeat-After-Me 自适应视觉提示注入,诱导 VLM 智能体执行指定任务

    发表
    场景
    AI Agent
    被测模型
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 6 个

    摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    深度解读完整解读
  5. 攻击arXiv 2609.01325

    VerTox:用可验证奖励引导的强化学习对神经排序模型实施语料投毒

    提出 VerTox,用可验证奖励强化学习生成误导文档并投毒检索语料

    发表
    被测模型
    SimLM-base、BGE-base、Cohere-embed-english-v3.0 等 8 个
    摘要VerTox 以可验证奖励微调小 LLM,生成能抬高排序并腐蚀事实的投毒文档。

    VerTox 用可验证奖励把小 LLM 微调成语料投毒生成器,用来探测神经排序器在注入文档下的暴露面。

    深度解读完整解读
  6. 攻击arXiv 2608.10393

    DURA:用扩散模型生成自然对抗补丁攻击 VLA 机器人模型

    提出 DURA,用扩散模型生成自然对抗补丁操控 VLA 机器人动作

    发表
    被测模型
    OpenVLA-7B、π0-FAST、openvla-7B
    摘要DURA 用扩散潜空间轨迹生成自然补丁,白盒与黑盒都能把 VLA 导向指定动作。

    DURA 是针对 VLA 的扩散式、补丁内容不受限的机器人攻击,同时支持白盒梯度和只看动作输出的黑盒。

    深度解读完整解读
  7. 攻击arXiv 2608.09867

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    利用加密思维块的跨模型重放,诱导弱模型逐字转写专有推理链

    发表
    攻击者
    黑盒
    被测模型
    Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5 等 13 个

    摘要论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    深度解读完整解读
  8. 攻击arXiv 2608.04565

    研究者提出 Breadcrumbing 长程攻击,可劫持 DeepResearch 类搜索 Agent 的证据链

    提出权威链劫持与轨迹引导策略演化,劫持搜索 Agent 的证据链

    发表
    场景
    web agent
    被测模型
    Qwen3.5-9B、Gemma4-31B、DeepResearch 等 7 个

    摘要论文揭示了多步搜索智能体在受限中间人操纵下的脆弱性,提出 ACH 策略与 TGSE 演化方法并完成系统验证。

    深度解读完整解读
  9. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
  10. 攻击arXiv 2606.11265

    论文提出 CRCP 投毒框架,揭示 RAG 分块与重排序下的投毒失效问题

    提出 CRCP 框架,优化分块与重排下的 RAG 语料投毒

    发表
    被测模型
    GPT-4o、DeepSeek-R1、Qwen3-Max 等 11 个
    摘要CRCP 把投毒做成多阶段一致性问题。

    CRCP 研究的是带分块和重排的 RAG 语料投毒,而不是只提高文档级检索分数。

    深度解读完整解读
  11. 攻击arXiv 2607.21619

    ASO:用GRPO优化视觉风格放大MLLM越狱攻击

    提出 ASO,用 GRPO 优化视觉风格以放大越狱攻击

    发表
    攻击者
    灰盒
    被测模型
    GPT-4.1-mini、Gemini-2.5-Flash、Qwen3-VL 等 6 个

    摘要论文揭示了 MLLM 的风格敏感性脆弱面,提出 ASO 框架利用强化学习优化风格触发器,有效放大了现有视觉越狱效果。

    深度解读完整解读
  12. 攻击arXiv 2605.21541

    研究者提出 FRA-Attack 频域正则化方法,提升对闭源 MLLM 的迁移攻击效果

    提出 FRA-Attack,用频域对齐与梯度正则做可迁移定向视觉攻击

    发表
    攻击者
    黑盒
    被测模型
    GPT-5.2、GPT-5.4、Claude-Opus-4.6 等 15 个
    摘要FRA-Attack 以频域对齐和梯度低通做可迁移定向攻击,闭源面板上作者称整体更强,Gemma 除外。

    FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。

    深度解读完整解读