跳到正文

UK AISI · 精选

10月9日 · 周五

UK AISI · 精选

今天还没有新的精选
10月7日周三
  1. X @AISecurityInst、arXiv 等 3 个来源X @AISecurityInst 等 3 个来源 · 3 篇报道 · 56

    UK AISI 开源 Transect 智能体评测分析工具

    UK AISI 发布开源 Python 包 Transect,基于 Inspect Scout 构建,把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成交互式报告,供评审者跳转到对应记录片段核对自动分析的依据。用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。同期,研究者也发布开源包 Transect,用于在长程 LLM Agent 评测中保留可观测性:用户在可复用的评测族配置中指定任务上下文与行为词汇,判分模型与分析设置另行提供;其可导航报告把记录事件、token 用量、子 Agent 活动与模型生成的行为标签对齐到同一按回合的时间线上,评审者可快速把握一次运行的脉络、把任一标签或事件追溯到来源回合,并导出底层数据表做跨运行分析。UK AISI 指出,随着智能体编写代码、运行实验并相互协作,复杂评测越来越难解读,单一评测分数会掩盖智能体达成该分数的具体过程,Transect 让评测者能够查看轨迹中的过程细节。

10月3日周六
  1. UK AI Security Institute · 53

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

已经到底了