跳到正文
10月8日 · 周四

红队 · 论文

找到 8 篇

另有 66 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  2. 防御arXiv 2610.03089

    COBRA:为计算机使用 Agent 防御分支引导攻击的双 LLM 架构

    提出 COBRA 双 LLM 架构,防御计算机使用智能体的分支转向攻击

    发表
    测试
    OpenCUA-7B、OpenCUA-32B、gpt-5 等 6 个

    摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。

    深度解读完整解读
  3. 风险行为arXiv 2609.35799

    研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法

    在模拟环境中复现级联失准行为并降低审计诱导开销

    发表
    场景
    AI Agent
    测试
    Qwen 3.8 Max、GLM 5.2、GLM 5.3 等 9 个

    摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。

    深度解读完整解读
  4. 攻击arXiv 2610.00392

    A2A-TIBA:针对 A2A 协议 LLM 智能体的间接提示注入攻击与三层同构攻防模型

    提出 A2A-TIBA 间接提示注入,诱导智能体部署常驻回调并外传数据

    发表
    测试
    qwen3.8-max、hermes-agent 0.21.0、MiniMax-M3 等 8 个
    摘要A2A-TIBA 一次植入后绕过智能体,GDA 用四类结果定位防线,ELA-ITL 把信封标注列为第三层。

    A2A-TIBA 把间接提示注入和绕过放进 A2A:gray-box 攻击者已能投递任务,诱导目标部署常驻回调程序后,下令和外传不再经过智能体。

    深度解读完整解读
  5. 防御arXiv 2609.34518

    SEAD 论文提出工具型 Agent 的状态视角攻击与防御方法 DART 与 SAGE

    提出工具智能体的状态攻击 DART 与预执行防御 SAGE

    发表
    场景
    AI Agent
    测试
    Huihui-Qwen3.8-27B-abliterated、Qwen3-4B-Instruct-2507、Qwen3.8-27B 等 8 个

    摘要论文提出状态控制框架 SEAD、攻击 DART 与防御 SAGE,实验显示执行反馈与环境探测在攻防交互中具有关键作用。

    深度解读完整解读
已经到底了