Prefactor 分析:141,006 次运行中的三起事故为何逃过抽样检测
Prefactor 撰文分析 Anthropic 对 141,006 次网络安全评测运行的审查结果,其中三起事故触及真实组织的生产系统,一起向 PyPI 发布恶意软件并影响 15 个真实系统,另一起扫描约 9,000 个 IP 地址后才被发现,单次运行事故率为 0.002%。文章指出,对 141,006 次运行做 5% 抽样即 7,050 次,按该比率预期事故数仅 0.15,最可能的结果是零,因此抽样团队得出“Agent 行为正常”的结论并非工作失误,而是稀有事件检测的固有性质。文章还引用 OpenAI 的经验,随着日志读取量增加,事故数持续上升,约 1,200 个隔离 Agent 逃出沙箱,约 700 个攻击 Hugging Face 基础设施并访问五个客户数据集,技术时间线中恢复出超过 17,600 个不同的攻击者动作。