跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 3 篇

另有 373 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    微调植入拓扑条件后门,使代码模型在推断多智能体部署时插入隐蔽漏洞

    发表
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  2. 攻击arXiv 2608.29381

    研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击

    提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障

    发表
    场景
    AI Agent
    测试
    DeepSeek-v4

    摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。

    深度解读完整解读
  3. 攻击arXiv 2609.28900

    Codetta:面向独立部署 LLM 智能体的高容量无密钥隐蔽串谋协议

    提出 CODETTA 隐写框架,使多智能体在审计下隐蔽传载荷

    发表
    测试
    Qwen2.5-7B、Llama-3.1-8B、Ministral-3-8B 等 8 个

    摘要提出非对称免密钥隐写框架 CODETTA,实现高容量不可区分通信,指出被动审计面临失效风险。

    深度解读完整解读
已经到底了