Goodfire 部署生产级模型内部监控
Goodfire 发布“由内而外”监控器,通过 Baseten 向客户提供,可在智能体运行中实时读取模型内部激活信号,由探针触发二次核查,客户可选监控攻击性黑客、化生武器滥用和奖励作弊等风险。在 Kimi K3 上测试约 1,500 次会话,监控成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 10,000 美元;探针捕获 94% 的恶意黑客会话,并把 8.7% 的无害会话送去复核。Goodfire 另为 Kimi K3 和 GLM 5.3 构建基于探针的网络安全监控系统,部署在生产推理栈上,探针作为一线过滤器,只把可疑交互升级给 LLM 裁判。该级联在 5.5% 良性会话中断率下达到约 93% 召回,成本低于每百万次交互 200 美元,比逐轮调用裁判便宜约 50 倍,且不增加推理延迟。在 FAR.AI 为期两天、基于 140 个越狱策略的静态红队测试中,启用监控后通用越狱从 66 个降到 0 个。