UK AISI 开源 Transect 智能体评测分析工具
UK AISI 发布开源 Python 包 Transect,基于 Inspect Scout 构建,把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成交互式报告,供评审者跳转到对应记录片段核对自动分析的依据。用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。同期,研究者也发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性:用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供;其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。UK AISI 指出,随着智能体编写代码、运行实验并相互协作,复杂评测越来越难解读,单一评测分数会掩盖智能体达成该分数的具体过程,Transect 让评测者能够查看轨迹中的过程细节。