跳到正文
10月7日周三
  1. arXiv · 收录 · 原文 论文↑156

    Transect:为长程 LLM Agent 评测保留可观测性的开源工具

    研究者发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性。该工具基于 Inspect Scout 构建,用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供。其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。作者在一项生成近 1300 万 token 的 AI R&D 评测上演示了该流程,将 Agent 工作划分为与研究技能分类对应的行为阶段、子 Agent 委派与交互以及 token 使用;合并视图显示工作集中在操作性任务与稿件产出,几乎没有持续假设生成阶段的证据。

10月1日周四
  1. arXiv · 收录 · 原文 论文53

    Meerkat:跨大量 Agent 轨迹检测安全违规

    研究者提出 Meerkat,将聚类与智能体搜索结合,用自然语言描述违规行为并在大量 Agent 轨迹中定位稀疏失败。该方法不依赖种子场景、固定流程或穷举,通过结构化搜索和自适应调查有潜力的区域来发现违规。在滥用、失准和任务博弈等场景中,Meerkat 的违规检测效果显著优于基线监控器,并在一个头部 Agent 基准上发现大量开发者作弊行为,在 CyBench 上找到的奖励作弊案例比此前审计多近 4 倍。论文共 35 页、17 张图,作者为 Adam Stein、Davis Brown、Hamed Hassani、Mayur Naik、Eric Wong。

已经到底了