跳到正文
10月9日 · 周五

Agent 安全 · 论文

找到 69 篇
  1. 攻击arXiv 2605.12673

    UC Berkeley 提出 BenchJack,自动审计 10 个 Agent 基准并发现 219 处奖励作弊缺陷

    提出 BenchJack 系统审计智能体基准的奖励作弊缺陷

    发表
    场景
    AI Agent
    摘要论文系统揭示了智能体基准的奖励作弊隐患,提出自动化红队审计与迭代修补系统 BENCHJACK。

    论文系统研究了主流 AI 智能体基准评测中的奖励作弊问题,提出了首个针对基准缺陷的自动化红队审计与生成对抗式迭代修补系统 BENCHJACK。

    深度解读完整解读
  2. 评测与基准arXiv 2610.07359

    论文实测 Agent 工具调用门控栈的失败相关性

    提出 nmult,实测 Agent 动作门控栈的层间错误相关性

    发表
    场景
    AI Agent
    摘要论文实测发现大模型裁判间错误显著相关,作者主张按机制选型并在整栈层面度量防护增益。

    论文是一项针对智能体动作拦截防御堆叠故障关联性与实际组合价值的实证测量研究。

    深度解读完整解读
  3. 防御arXiv 2610.04699

    CoVer:用干预检验为 Agent 构造可判定规则边界

    提出 COVER,以不咨询模型的干预门准入 Agent 规则自动执行

    发表
    场景
    AI Agent
    摘要自可判定不能向模型索取。

    这篇工作测的是智能体验证器在检查之前的分流:外部规则里的哪条谓词能用固定过程解决,哪条必须交给评审。

    深度解读完整解读
  4. 防御arXiv 2610.04975

    论文提出长程智能体自生子目标的运行时授权机制

    提出运行时授权机制,检查长程智能体自生子目标是否精化根契约

    发表
    场景
    AI Agent
    摘要用版本化目标图授权保住重规划,并挡住自生成子目标变成新权威。

    长时程工具使用把目标演化变成授权状态的一部分。本文在单 principal、单根、有限结构化域中,把自生成子目标的创建、替换、同根委托和同根 join 做成可检查转移,并在提交边界重查受保护效应。

    深度解读完整解读
  5. 其他arXiv 2609.10630

    论文提出 AI 安全设计保障架构:结合 Scientist AI 模型级监督与系统级控制

    提出结合模型级监督与系统级控制的智能体保障架构

    发表
    场景
    AI Agent
    摘要作者梳理事件中的多层失效,主张监督模型、系统控制与证据治理并用。

    Lu 与 Bengio 给出的是一套可逐层上移的保障架构和一组事件归类,不是已测量的防御系统。

    深度解读完整解读