跳到正文
10月10日 · 周六

全部论文

找到 10 篇

另有 244 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.30383

    研究者提出技能级联攻击

    提出技能级联攻击,把有害目标拆散到多个技能里绕过单技能扫描

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、GPT-5.4 Mini、Claude Opus 4.6 等 11 个

    摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。

    深度解读完整解读
  2. 攻击arXiv 2609.27542

    研究者用控制 token 注入删除 gpt-oss-20b 推理链并绕过思维链监控

    提出控制标记注入,清空工具 Agent 的思维链以绕过推理监控

    发表
    场景
    AI Agent
    被测模型
    openai/gpt-oss-20b、google/gemma-4-26B-A4B-it、deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 等 4 个

    摘要论文阐明控制标记注入可抑制 CoT 使监控失效并促成拒绝绕过,且工具执行受解析器宽容度影响。

    深度解读完整解读
  3. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  4. 攻击arXiv 2609.18217

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御

    提出跨通道分段攻击,利用 MCP 隐式信任外发敏感文件

    发表
    被测模型
    GPT-4o、GPT-4o-mini、GPT-5.4 等 15 个

    摘要论文揭示了 MCP 多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    深度解读完整解读
  5. 攻击arXiv 2608.16246

    CompoSkill 框架利用逐个通过扫描的 Agent 技能组合发起攻击

    提出 CompoSkill,将逐个通过扫描的技能编排为攻击链

    发表
    场景
    AI Agent
    被测模型
    GPT-5.4、Gemini-3.1-flash、DeepSeek-V4 等 4 个

    摘要论文分析了智能体技能组合风险,指出单包安全认证状态不具备可组合性,需转向路径级防护。

    深度解读完整解读
  6. 攻击arXiv 2603.24203

    研究者提出 TIP:用树结构搜索为 MCP 生成隐蔽注入载荷

    提出 TIP,用树搜索为 MCP 响应生成隐蔽注入载荷

    发表
    场景
    AI Agent
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-72B-Instruct、Llama3.1-8B-Instruct 等 8 个
    摘要TIP 在 MCP 工具响应上做黑盒注入。

    TIP 是面向 MCP 工具响应的 black-box 间接提示注入,目标是在不改工具元数据的情况下生成语义连贯的 JSON 载荷。

    深度解读完整解读
  7. 攻击arXiv 2510.04885

    RL-Hammer:用 GRPO 从头训练攻击模型

    提出 RL-Hammer,从零训练攻击模型经工具输出实施提示注入

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Meta-SecAlign-8B、Meta-SecAlign-70B 等 10 个
    摘要作者称通过无热启动的强化学习可有效突破具备防御的商业模型,论文提出的 RL-Hammer 促使业界关注提示注入风险。

    RL-Hammer 是一个无需热启动数据、基于 GRPO 算法从零训练的黑盒提示注入对抗攻击框架。现有针对大语言模型智能体的提示注入防御(如 Instruction Hierarchy 与 SecAlign)主要在静态或弱攻击下测试,在面对自动化强力攻击时的真实防御能力缺乏充分检验。方法的核心机制包括。

    深度解读完整解读
已经到底了