跳到正文
10月10日 · 周六

全部论文

找到 4 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 196 篇还没打标签,不在筛选结果里。

另有 196 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具型 Agent 的自适应攻击 DART 与预执行防御 SAGE

    发表
    场景
    AI Agent
    被测模型
    GPT-5.6 Luna、GPT-5.6 Terra、Gemini 3.8 Flash 等 5 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
  2. 攻击arXiv 2606.09084

    研究者提出 Context-Fractured Decomposition 攻击

    提出 CFD 跨会话分解攻击,利用工件来源缺口绕过工具型 Agent 的本地检查

    发表
    场景
    AI Agent
    被测模型
    GPT-4.1、GPT-5-nano、Claude-3.5-Sonnet 等 6 个
    摘要CFD 用无指令 artifact 把越狱拆到跨会话。

    CFD针对工具型 LLM 智能体:利用 artifact 来源不被跟踪这一部署失败模式,把有害目标拆开后延迟组合。

    深度解读完整解读
已经到底了