跳到正文
10月8日 · 周四

月之暗面 · Kimi · 论文

找到 2 篇
筛选
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。
  1. 评测与基准arXiv:2604.02947 ·

    AgentHazard:评估计算机使用智能体有害行为的基准

    提出AgentHazard基准,评测计算机使用智能体的执行层有害行为

    测试
    Qwen2.5-72B-Instruct、Qwen2.5-Coder-32B-Instruct、Qwen3-32B 等 12 个应用层
    摘要AgentHazard 评估了计算机使用智能体的执行安全,作者认为模型层对齐无法可靠保障智能体层面的安全性。

    AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。

    • 核心定位与挑战:智能体具有持久状态与直接操作环境的权限,现有基于单轮提示词或静态代码生成的安全评估无法捕捉由多步交互逐步拼凑而成的有害行为。
    • 基准构建流程:设计了涵盖 10 种风险类别与 10 种攻击策略的分类框架,通过在合法任务上下文中嵌入有害约束,结合沙箱真实执行过滤、多模型评判与人工审核,提炼出 2,653 个高质测试用例。
    • 智能体框架高攻击成功率:在全轨迹评测中,Claude Code 搭载 GLM-4.6 时 ASR 达到 82.90%(平均有害得分 7.05),搭载 Qwen3-Coder 时 ASR 为 73.63%;IFlow 下 Qwen2.5-Coder-32B-Instruct 的 ASR 达到 74.70%(Table 2)。
    • 静态防护模型有效性受限:主流独立防护分类器在首轮输入时的检出率均低于 5%,即使拼接全部任务步骤,表现最好的 Llama-Guard-3-8B 不安全检出率也仅为 27.03%(Table 3)。
    • 危害随交互步数逐步升级:多轮累积评测显示,Qwen2.5-Coder-32B-Instruct 在 IFlow 和 OpenClaw 中的 ASR 从第 1 轮到第 3 轮上升约两倍(Table 4),作者认为有害行为具有高度轨迹依赖性。
    • 作者结论与启示:作者指出模型层对齐无法可靠保障自主智能体的安全性,单纯依靠任务前文本过滤不足以阻断风险,未来亟需发展具备轨迹感知能力与运行时拦截机制的智能体防御方案。
    完整解读
  2. 评测与基准arXiv:2608.19741 ·

    微软发布 Thinkingbox 沙盒与 507 任务基准,评估有状态业务流程中的 Agent 可靠性

    构建THINKINGBOX沙盒与基准,评测有状态业务工作流中智能体的执行稳定性

    测试
    Claude Opus 5、GPT-5.4、GPT-5.6-sol 等 14 个应用层
    场景
    AI Agent
    摘要论文构建多轮业务沙箱与基准,分析多次重复执行差距并展示强化学习训练效果。
    • 研究定位:该研究提出了面向多轮有状态业务工作流的智能体交互沙箱 THINKINGBOX 及包含 507 个任务的评测基准 THINKINGBOX-BENCH。
    • 解决的核心问题:针对现有工具调用评测偏向代码与单次 API 语法正确性、忽视真实业务持久化状态变更与附带破坏的问题,构建了端到端可验证的闭环环境。
    • 方法设计要点:基于 MCP 协议实现任务级别的独立会话隔离与确定性重置,由受限的模拟用户配合多轮澄清,结合终端数据库状态比较与副作用提取实施严格的合取式判题。
    • 重要实验结果:评测 18 个模型展示出探索上限与重复执行稳定性的显著落差,Claude Opus 5 的 pass@1 为 66.50%,而在 20 次重复试验中全部成功的 passˆ20 降至 47.53%;Kimi-K3 的 pass@20 达 93.89%,但 passˆ20 仅为 17.60%;在 79,853 次失败轨迹中,工具使用错误占比达 79.9%,且 80.88% 的失败试验仍能正常终止并调用写工具。
    • 强化学习与基准价值:基于沙箱确定性奖励使用 GRPO 算法对 Qwen3.8-27B 进行全参数微调,其 pass@1 达 60.78%,超过专有模型 GPT-6 Astra(58.31%);相比 HumanEval+ 狭窄的分数区间,该基准有效拉开了不同智能体在复杂流程下的能力区分度。
    • 作者结论与启示:作者认为智能体偶然找到单次成功路径并不等同于具备稳定的业务执行能力,在面向高影响业务流程时,评测必须深入到底层持久化状态与附带损伤,而非仅依赖表层回复文本或工具调用格式。
    完整解读
已经到底了