跳到正文

工具与开源

今天还没有收录新动态

第 2 页更新的内容回到最新

10月1日周四
  1. arXiv · 收录 · 原文 论文53

    AgentBound:面向工具型 LLM Agent 安全的四路反事实评测框架

    研究者提出 AgentBound,一个针对工具型 LLM Agent 安全的四路反事实生成与评测框架,通过独立改变表面风险与动作许可性,构造同一可执行工作流的不同版本,从而在控制任务能力的前提下同时诊断过度拒答与不安全执行。该框架被实例化为一个经人工验证的 4000 任务评测套件,采用基于轨迹和基于后置状态的判断方式。在 17 种模型与 harness 配置上,高安全性常与授权任务完成率低并存:GPT-5.5 拦截了 99.5% 看似常规但未授权的动作,却只完成 28.7% 看似有风险但已授权的任务。

  2. 腾讯玄武实验室 · 收录 · 原文 25

    腾讯玄武 Atuin AI 在 CyberGym 上的表现:GLM-5.2 更新结果

    腾讯玄武 Atuin AI 换用 GLM-5.2 重新评估后,在 CyberGym 全部 1,507 个任务上 pass@1 达 84.8%(1,278 个任务),较 GLM-5.1 的 84.0% 提升 0.8 个百分点。相同 GLM-5.1 下,Atuin AI 比 Claude Code 的 68.7% 高出 15.3 个百分点。本次实验新增代理白名单,仅允许连接 LLM 提供商、Python/npm 包注册表和内部服务,其余设置不变。

  3. NVIDIA 技术博客:可信 AI 与网络安全 · 收录 · 原文 13

    NVIDIA AVO 在 ARC-AGI-3 达到 100%,展示面向长周期自主智能体的前沿级通用架构

    NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,其定位是支撑长周期自主智能体的前沿级通用架构。该工作强调前沿语言模型只是 AI 智能体的组件之一,真正决定可靠性的是被称为 harness 的外围系统——它负责模型获取上下文、调用工具、维持状态、响应反馈以及从失败中恢复的方式。

9月30日周三
已经到底了