跳到正文

工具与开源 · 精选

10月10日 · 周六

工具与开源 · 精选

今天还没有新的精选
10月4日周日
  1. Scale AI Research / SEAL · 46

    Scale AI 推出 READY 企业 Agent 部署评测框架

    Scale AI 研究团队发布 Reliable Enterprise Agent Deployment(READY)评测框架,用于判断 AI Agent 能否在具体企业工作流中部署。该框架在保留各工作流自身成功定义的前提下,测量人机系统的可靠性与运行成本,从候选监督策略中选出满足指定可靠性目标的最低成本策略,并在留出案例上做统计资格认定,输出包含可靠性、人工监督负担和成本的部署画像。READY 以开源测试床实现,将工作流定义、执行、评测与部署资格认定解耦,可运行在现有 Agent 评测基础设施上。在覆盖 16 个 Agent 系统、750 个案例的临床审计端到端案例中,两个自主准确率仅差 0.3 个百分点(72.8% 与 72.5%)的系统,在同一 76% 可靠性目标下分别需要 39.2% 和 29.6% 的人工复核。

10月3日周六
  1. Snyk Labs(AI Threat Labs,含原 Invariant Labs) · 51

    Snyk Labs 实测 Opus 4.7 等模型在四个代码库上的漏洞发现能力

    Snyk Labs 用四级难度递减的提示词,让 Opus 4.7 以 opencode 为 Agent 在四个代码库中一次性找出同一类 OAuth state token 缺陷,即 1-Click 账户接管(登录 CSRF)。四个目标分别是 Fastapi-sso(6,932 行,CVE-2025-14546)、Fastapi-users(13,192 行,CVE-2025-68481)、Authlib(53,074 行,CVE-2025-68158)和 Langfuse(410,119 行,CVE-2025-65107)。作者发现 Opus 4.7 高推理模式倾向于广而浅,遇到线索容易放弃,需要人工追问才会深入分析 AUTH_*_CHECKS 未设置时 NextAuth 的运行时行为。作者强调这不是基准测试,只是一次小规模探索。

已经到底了