跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 3 条 · 本页 3 条 · 共 3 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源302新闻与研究303细分与主体7来源:UK AI Security InstituteUK AI SecurityInstitute1 条材料来源:X @AISecurityInstX@AISecurityInst1 条材料来源:Adversa AIAdversa AI1 条材料动态:UK AISI 开源 optstop:按精度提前停止评估以节省算力动态2026-08-27UK AISI 开源 optstop:按精度提前停止评估以节省算力动态:AISI 开源 optstop 优化评估 token 消耗动态2026-08-27AISI 开源 optstop 优化评估 token 消耗动态:Adversa AI 解析什么是 agent harness 以及如何加固动态2026-09-14Adversa AI 解析什么是 agent harness以及如何加固方向:安全评测安全评测2方向:工具与开源工具与开源3方向:UK AISIUK AISI3方向:其他方向其他方向1方向:Agent 安全Agent 安全1方向:MetaMeta1方向:OpenAIOpenAI1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。2 个较少出现的方向归入「其他方向」,点选可查看。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 3 条
  • 动态UK AI Security Institute

    UK AISI 开源 optstop:按精度提前停止评估以节省算力

    UK AISI 发布开源 Python 包 optstop,接入其 Inspect 评估框架,在模型表现估计足够精确时提前停止评估运行,以减少不必要的算力消耗。optstop 在任务重复和分组两个层级跟踪可信区间,采用精度与稳定化两条停止规则,未满足规则的分组仍跑满计划预算;针对成功率低于 1% 的罕见成功情形设有保守机制,并要求任务随机排序以避免顺序偏差。在 MATH、GPQA Diamond 和 WritingBench 等公开基准上,覆盖二值、序数和连续三类评分以及低中高三种预期表现水平,共 9 种设置下节省了 57% 至 97% 的计划试验,且未影响分数估计。该工具支持事后验证、影子模式和实时停止三种渐进采用方式,使用 Inspect 时只需在评估配置中加几行代码。

  • 动态X @AISecurityInst

    AISI 开源 optstop 优化评估 token 消耗

    一些前沿 AI 评估需要数亿 token,而每一次浪费的试验都有真实成本。 我们推出 optstop:我们的开源工具,能在估计已经精确的地方停止评估,在还不精确的地方继续运行。🧵

  • 动态Adversa AI

    Adversa AI 解析什么是 agent harness 以及如何加固

    Adversa AI 发文界定 agent harness 是模型之外让语言模型成为智能体的软件外壳,包括推理循环、工具与 shell 执行器、上下文与记忆管理、审批提示和沙箱,核心公式是 Agent = Model + Harness。文章认为安全边界应落在 harness 而非模型,因为拒答只是模型的偏好,而 harness 拒绝执行才构成控制。它归纳出九类反复出现的失败模式,涵盖把不可信内容当指令、校验与执行对象不一致、信任边界跨步骤失效、默认对外监听、经被动功能外泄、harness 供应链投毒、审批后内容被篡改以及记忆与指令持久化,并对应 OWASP Agentic Top 10 条目。