跳到正文
10月7日周三
  1. UK AI Security Institute · 收录 · 原文 ↑156

    UK AISI 开源 Transect,把大规模 Agent 评测记录转成可核查报告

    UK AISI 发布开源 Python 包 Transect,基于 Inspect Scout 构建,把 Agent 评测记录中的活动标签、token 用量和记录事件放到同一条以 turn 为索引的时间线上,生成一份交互式报告,供评审者跳转到对应记录片段核对自动分析的依据。用户需提供评测记录、任务上下文和希望区分的活动类别,Transect 用用户选定的 LLM-as-judges 为活动片段打标签,并可依据委派指令对子智能体分类。在一项开放式 AI 研究评测中,AISI 用 Transect 追踪研究计划、基线代码、实验草稿和盲审四份文档在多个智能体间的读写流转,显示子智能体先协作研究计划与代码库,实验开始后集中协作实验设计与数据。Transect 保存活动标签和单次模型判断,可重新打开分析而无需再次调用模型;重复判断或使用多个 judge 模型时,评审者能看到判断分歧之处。

    1 条报道 · 1 个来源查看事件时间线与全部报道

    推荐理由AISI 开源了把长 Agent 评测记录转成可核查交互报告的工具,并给出多智能体协作的案例分析。

10月5日周一
10月3日周六
  1. UK AI Security Institute · 收录 · 原文 53

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

    推荐理由AISI 公开了评估算力自适应停止的开源实现与测试数据,做前沿评估的团队可据此调整采样预算分配。

10月1日周四
  1. Adversa AI · 收录 · 原文 43

    Adversa AI 解析什么是 agent harness 以及如何加固

    Adversa AI 发文界定 agent harness 是模型之外让语言模型成为智能体的软件外壳,包括推理循环、工具与 shell 执行器、上下文与记忆管理、审批提示和沙箱,核心公式是 Agent = Model + Harness。文章认为安全边界应落在 harness 而非模型,因为拒答只是模型的偏好,而 harness 拒绝执行才构成控制。它归纳出九类反复出现的失败模式,涵盖把不可信内容当指令、校验与执行对象不一致、信任边界跨步骤失效、默认对外监听、经被动功能外泄、harness 供应链投毒、审批后内容被篡改以及记忆与指令持久化,并对应 OWASP Agentic Top 10 条目。

已经到底了