Goodfire 部署生产级模型内部监控
先了解这件事
Goodfire 发布“由内而外”监控器,通过 Baseten 向客户提供,可在智能体运行中实时读取模型内部激活信号,由探针触发二次核查。在 Kimi K3 上测试约 1,500 次会话,监控成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 10,000 美元;探针捕获 94% 的恶意黑客会话,把 8.7% 的无害会话送去复核。客户可选监控攻击性黑客、化生武器滥用和奖励作弊等风险。另一篇报道称,Goodfire 为 Kimi K3 和 GLM 5.3 构建基于探针的网络安全监控系统并部署在生产推理栈上,探针作为一线过滤器,只把可疑交互升级给 LLM 裁判,在 5.5% 良性会话中断率下达到约 93% 召回,成本低于每百万次交互 200 美元,比逐轮调用裁判便宜约 50 倍,且不增加推理延迟;在 FAR.AI 为期两天、基于 140 个越狱策略的静态红队测试中,启用监控后通用越狱从 66 个降到 0 个。
AI 根据报道生成 · 18 小时前更新
后续时间线
- Goodfire Research精选Goodfire 在 Kimi K3 与 GLM 5.3 上部署探针级联网络监控
Goodfire 为 Kimi K3 和 GLM 5.3 构建了基于探针的网络安全监控系统,并部署在生产推理栈上。探针读取模型内部激活作为一线过滤器,只把可疑交互升级给 LLM 裁判。该级联在 5.5% 良性会话中断率下达到约 93% 召回,成本低于每百万次交互 200 美元,比逐轮调用裁判便宜约 50 倍,且不增加推理延迟。在 FAR.AI 为期两天、基于 140 个越狱策略的静态红队测试中,启用监控后通用越狱从 66 个降到 0 个,1120 次非通用越狱交互的攻击成功率从至少 9–40% 降至 0.1–1.6%。用 Kimi K3 的数据训练出的监控流程也能迁移到 GLM 5.3。
- TechCrunch AIGoodfire 推出“由内而外”监控器,低成本捕捉失控 AI 智能体
Goodfire 发布了一类监控 AI 模型内部激活的“由内而外”监控器,通过 Baseten 向客户提供,可在智能体运行中实时读取内部信号并由探针触发二次核查。在 Kimi K3 上测试约 1,500 次会话,监控成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 10,000 美元;探针捕获了 94% 的恶意黑客会话,并把 8.7% 的无害会话送去复核。客户可选监控攻击性黑客、化生武器滥用和奖励作弊等风险,并设定记录、人工复核或直接拒答等自动响应。
相关讨论
关注度走势
每天新增来源
- 10月9日 新增 2 个来源(2 家媒体、0 个账号)
- 10月10日 新增 0 个来源(0 家媒体、0 个账号)