跳到正文
10月8日 · 周四

月之暗面 · Kimi · 论文

精选论文 3 篇
  1. 评测/基准arXiv:2604.02947 · 54

    AgentHazard:评估计算机使用智能体有害行为的基准

    作者针对计算机使用智能体提出 AgentHazard 基准,GLM-4.6 在 Claude Code 下 ASR 达 82.90%。

    • 82.90%Claude Code下GLM-4.6全轨迹ASR(Table 2)
    • 73.63%Claude Code下Qwen3-Coder全轨迹ASR(Table 2)
    • 74.70%IFlow下Qwen2.5-Coder-32B全轨迹ASR(Table 2)
    6 问速览现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。
    1. 这篇论文试图解决什么问题?

      现有基准难以评估计算机使用智能体在多步执行与工具调用中由局部合理操作累积涌现出的有害行为。

    2. 有哪些相关研究?

      相关工作涵盖大语言模型文本与代码安全评测,以及智能体能力和安全基准,但未针对多步局部合理动作组合。

    3. 论文如何解决这个问题?

      构建由 10 类风险与 10 种策略组成的分类体系,通过任务模板生成、沙箱执行过滤、模型评判与人工审核产出基准。

    4. 论文做了哪些实验?

      评测显示当前智能体存在脆弱性,GLM-4.6 在 Claude Code 下 ASR 达 82.90%,防护模型全轮拼接最高检出 27.03%。

    5. 有什么可以进一步探索的点?

      作者指出当前防护模型缺乏轨迹感知且需探索运行时防御,其实验覆盖了 3 个框架与 8 款开源或可部署模型。

    6. 总结一下论文的主要内容

      AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    完整解读
  2. 评测/基准arXiv:2608.19741 · 53

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    作者在507个业务任务上评测智能体,Claude Opus 5从66.50% pass@1降至47.53% passˆ20。

    • 66.50%Claude Opus 5在THINKINGBOX-BENCH上的pass@1
    • 47.53%Claude Opus 5在THINKINGBOX-BENCH上的passˆ20
    • 93.89%Kimi-K3在THINKINGBOX-BENCH上的pass@20
    6 问速览现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。
    1. 这篇论文试图解决什么问题?

      现有工具评测难以衡量智能体在多轮状态化业务中的完成度与状态变更副作用。

    2. 有哪些相关研究?

      相关研究涵盖交互沙箱、工具调用基准与专业工作流评测,本文聚焦状态化业务。

    3. 论文如何解决这个问题?

      构建基于MCP协议的THINKINGBOX沙箱,通过状态比对与副作用提取进行合取判题。

    4. 论文做了哪些实验?

      在507个任务上评测18个模型,Claude Opus 5在pass@1领先但多次试验稳定率下降。

    5. 有什么可以进一步探索的点?

      作者指出判题未覆盖回复文本保真度且依赖单一模拟器,实验覆盖5个领域507个任务。

    6. 总结一下论文的主要内容

      论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。

    完整解读
已经到底了