跳到正文
10月8日 · 周四

红队 · 论文

找到 25 篇

另有 97 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2608.04741

    LoginTrap:针对 LLM Web Agent 的任务无关钓鱼式间接提示注入攻击

    提出 LoginTrap,用网页弹窗实施任务无关钓鱼式间接提示注入并窃取敏感信息

    发表
    测试
    GPT-4o、Gemini 3 Flash、Claude Sonnet 4 等 7 个

    摘要揭示网络智能体在黑盒网页下的登录诱导风险,利用模糊测试生成话术并跨骨干和架构验证了隐私泄露威胁。

    深度解读完整解读
  2. 攻击arXiv 2610.09240

    WebMirage 用对抗图像劫持视觉网页 Agent 的浏览器操作

    提出 WebMirage,用对抗图像劫持视觉网页智能体的浏览器操作

    发表
    测试
    LLaVA-v1.5-13B、LLaVA-v1.6-34B、MiniCPM-o-8B 等 6 个
    摘要论文提出了针对网络智能体的端到端视觉红队框架 WebMirage,揭示了从视觉定位到浏览器执行的安全脆弱性。

    WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。

    深度解读完整解读
  3. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,借 MCP 多通道隐式信任外发敏感数据

    发表
    测试
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  4. 攻击arXiv 2607.23496

    Concept2Scenario:用 SAE 概念归因发现可迁移的越狱场景

    提出 Concept2Scenario,借助内部概念归因发现可迁移的越狱场景

    发表
    攻击者
    白盒、黑盒
    测试
    Qwen3.5-9B、Llama-3.1-8B、Ministral-3-8B 等 10 个

    摘要该研究从表征空间因果归因揭示场景削弱拒绝的机制,发现可复用脆弱场景先验,提升多模型黑盒越狱效能与探索速度。

    深度解读完整解读
  5. 攻击arXiv 2607.11698

    AHA 用自动研究循环发现生产 Agent 漏洞概念

    提出 AHA 自动科研循环,发现生产级智能体的可复用漏洞概念

    发表
    攻击者
    黑盒
    测试
    Minimax-M2.7、Kimi-K2.6、Deepseek-V4-Pro 等 5 个
    摘要论文提出基于可证伪科研循环的 AHA 框架,从生产级智能体中挖掘并沉淀漏洞概念图,提升攻击复用率并指导防御加固。

    AHA 是一项针对生产级 LLM 智能体自动化红队测试的研究,旨在解决传统方法仅保留具体攻击载荷而缺乏成因解释、导致跨版本复用困难且无法指导修复的问题。

    深度解读完整解读
  6. 攻击arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据

    发表
    测试
    MiniMax-M3、deepseek-v4-pro、glm-5.3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  7. 攻击arXiv 2609.09798

    CS-Guard:首个面向代码生成安全的 LLM 护栏评测基准

    提出 CS-Guard 基准与虚构场景攻击,评测代码生成护栏

    发表
    攻击者
    黑盒、无盒
    测试
    CodeLlama-13B-Instruct、DeepSeekCoder-V2-Lite-16B、GPT-OSS-20B 等 7 个

    摘要论文提出了代码安全护栏基准 CS-Guard,评估发现现有护栏对虚构场景攻击和代码级恶意请求防御较弱。

    深度解读完整解读
  8. 攻击arXiv 2607.18056

    上海 AI 实验室提出 Intern-BioBreaker,在 14 个前沿模型上暴露生物安全越狱风险

    提出生物红队模型 Intern-BioBreaker,多轮越狱诱导模型输出可操作生物危害

    发表
    测试
    DeepSeek-V3、Kimi-K2.6、DeepSeek-V4-Pro 等 14 个

    摘要论文通过构建专用红队模型评估前沿大模型的生物安全漏洞与物理转化风险。

    深度解读完整解读
  9. 攻击arXiv 2609.38253

    CollageAttack:利用跨模态对齐缺陷对 T2I 模型实施空间文本组合越狱

    提出 CollageAttack,用空间文本碎片重组越狱文生图模型

    发表
    攻击者
    黑盒
    测试
    GPT-Image-2、Doubao-Seedream-5.0-Lite、Wan2.7-Image-Pro 等 5 个

    摘要系统揭示 T2I 跨模态空间合成安全漏洞,证实离散无害元素可在图像层面重构有害意图并放大传播强度。

    深度解读完整解读
  10. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出爆炸提示词,用条件触发的间接注入延迟诱发恶意工具调用

    发表
    场景
    AI Agent
    测试
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 14 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读