跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 232 篇还没打标签,不在筛选结果里。

另有 232 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.22510

    特拉维夫大学提出爆炸性提示词:条件触发的间接提示注入可绕过九款生产 Agent

    提出条件触发的爆炸提示词,并设计摄入期检测器 DeFuse

    发表
    场景
    AI Agent
    被测模型
    Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen2.5-32B-Instruct 等 15 个
    摘要论文揭示了条件触发使提示注入绕过防御并在触发时执行工具,提出轻量检测器并在摄入期有效防范。

    论文针对大语言模型智能体面临的间接提示注入威胁,研究了利用条件句式实现时间分离的爆炸提示词。

    深度解读完整解读
  2. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
  3. 攻击arXiv 2605.08460

    论文建模多智能体网络中的子智能体继承攻击面

    建模并利用多智能体网络中子智能体生成时的记忆继承漏洞

    发表
    被测模型
    MiniMax M2.5、Llama-4-Maverick-17B-128E-Instruct-FP8、Qwen3.5-Plus 等 5 个
    摘要形式化子智能体继承,在 OpenClaw 上演示四类编排层漏洞并提出防御。

    作者对多智能体网络里的子智能体继承做形式化分析,并用开源框架上的 PoC 演示编排层如何让单点妥协继续扩散。

    深度解读完整解读
已经到底了