Goodfire 推出“由内而外”监控器,低成本捕捉失控 AI 智能体
Goodfire says its new ‘inside-out’ monitors catch rogue AI agents at a fraction of the cost
AI 导读
Goodfire 发布了一类监控 AI 模型内部激活的“由内而外”监控器,通过 Baseten 向客户提供,可在智能体运行中实时读取内部信号并由探针触发二次核查。在 Kimi K3 上测试约 1,500 次会话,监控成本约 51 美元,而用廉价模型逐步检查需 233 美元、顶级模型约 10,000 美元;探针捕获了 94% 的恶意黑客会话,并把 8.7% 的无害会话送去复核。客户可选监控攻击性黑客、化生武器滥用和奖励作弊等风险,并设定记录、人工复核或直接拒答等自动响应。
阅读原文