跳到正文
10月10日 · 周六

全部论文

找到 8 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 242 篇还没打标签,不在筛选结果里。

另有 242 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  2. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件

    发表
    被测模型
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  3. 攻击arXiv 2606.12716

    PaperGuard:针对多模态 AI 同行评审的攻击与防御基准

    提出 PaperGuard,用图文注入与梯度扰动抬高自动审稿分数并检测恶意指令

    发表
    被测模型
    Claude-sonnet-4.5、GPT-4o、GPT-4.1 等 11 个
    摘要PaperGuard 测到提示注入与白盒视觉抬分,并比较分块检索防御。

    PaperGuard同时评测并检测多模态 AI 审稿中的评分操纵。

    深度解读完整解读
  4. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
  5. 攻击arXiv 2603.24203

    研究者提出 TIP:用树结构搜索为 MCP 生成隐蔽注入载荷

    提出 TIP,用树搜索为 MCP 响应生成隐蔽注入载荷

    发表
    场景
    AI Agent
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-72B-Instruct、Llama3.1-8B-Instruct 等 8 个
    摘要TIP 在 MCP 工具响应上做黑盒注入。

    TIP 是面向 MCP 工具响应的 black-box 间接提示注入,目标是在不改工具元数据的情况下生成语义连贯的 JSON 载荷。

    深度解读完整解读
  6. 攻击arXiv 2510.04885

    RL-Hammer:用 GRPO 从头训练攻击模型

    提出 RL-Hammer,从零训练攻击模型经工具输出实施提示注入

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Meta-SecAlign-8B、Meta-SecAlign-70B 等 10 个
    摘要作者称通过无热启动的强化学习可有效突破具备防御的商业模型,论文提出的 RL-Hammer 促使业界关注提示注入风险。

    RL-Hammer 是一个无需热启动数据、基于 GRPO 算法从零训练的黑盒提示注入对抗攻击框架。现有针对大语言模型智能体的提示注入防御(如 Instruction Hierarchy 与 SecAlign)主要在静态或弱攻击下测试,在面对自动化强力攻击时的真实防御能力缺乏充分检验。方法的核心机制包括。

    深度解读完整解读
已经到底了