跳到正文
10月8日 · 周四

红队 · 论文

找到 7 篇

另有 67 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2608.09476

    ActBench:面向协作智能体行为安全的自演化基准

    构建 ActBench 评测协作智能体多步执行中的操作级行为安全

    发表
    测试
    Claude-Opus-4.8、Claude-Sonnet-4.6、GPT-5.5 等 15 个

    摘要ActBench 通过自演化搜索与双证据重构评测轨迹行为安全,揭示基础模型决策差异主导了协同智能体的操作风险。

    深度解读完整解读
  2. 评测与基准arXiv 2609.35799

    研究者复现 OpenAI-HuggingFace 事件中的失准行为,并提出自动化对齐测试方法

    在模拟环境中复现级联失准行为并降低审计诱导开销

    发表
    场景
    AI Agent
    测试
    GLM 5.2、GLM 5.3、Kimi K3 等 9 个

    摘要论文复现了 OpenAI–HF 事件四步失准行为,作者报告高阶描述结合算力可自动诱导,并展示了 RL 降本潜力。

    深度解读完整解读
  3. 评测与基准arXiv 2609.26900

    Ajar:在 AgentDojo 上测量 Agent 防御中未关闭的权限

    提出 Ajar,测量 Agent 防御放行任务不需要的工具调用

    发表
    场景
    AI Agent
    测试
    Sonnet-5、Haiku-4.5、Sonnet-4.5
    摘要Ajar 用宿主基准的真值给防御的开放权限打分,OPL 独立于攻击成功和效用。

    Ajar 量的是智能体防御留下的开放权限:任务不需要、但防御仍会允许的工具调用。

    深度解读完整解读
已经到底了