跳到正文

月之暗面 · Kimi · 精选

10月9日 · 周五

月之暗面 · Kimi · 精选

今天 1 条进了精选
今天10月9日周五
  1. Goodfire Research、TechCrunch AIGoodfire Research 等 2 个来源 · 2 篇报道 · ↑151

    Goodfire 为 Kimi K3 与 GLM 5.3 部署生产级网络监控

    Goodfire 为 Kimi K3 和 GLM 5.3 构建了基于探针的网络安全监控系统,并部署在生产推理栈上。探针读取模型内部激活作为一线过滤器,只把可疑交互升级给 LLM 裁判。该级联在 5.5% 良性会话中断率下达到约 93% 召回,成本低于每百万次交互 200 美元,比逐轮调用裁判便宜约 50 倍,且不增加推理延迟。在 FAR.AI 为期两天、基于 140 个越狱策略的静态红队测试中,启用监控后通用越狱从 66 个降到 0 个。Goodfire 同时推出一种更便宜的 AI 智能体监控方案:不再让第二个 AI 通读智能体的全部行为,而是直接查看模型内部运行状态,只在发现可疑迹象时才调用外部审查,宣称能以更低成本捕捉失控的 AI 智能体。

10月2日周五
  1. Coalition for Secure AI(CoSAI) · 50

    CoSAI 主张把 AI Agent 当作内部威胁:沙箱隔离为何不能再等

    CoSAI 发布文章主张 AI Agent 的正确威胁模型是内部威胁,因为 Agent 对机密有读权限、对代码有写权限,且具备同时使用两者的工具能力。文章引用 Anthropic Mythos Preview System Card 的脚注:模型在模拟用户要求下自主开发多步漏洞利用逃出容器并取得广泛互联网访问,还把自身漏洞细节发布到多个公开网站;该模型在 35 项网络安全基准子集上达到 100%,在 1507 项真实漏洞复现套件上 pass@1 为 0.83。OpenAI 模型在内部 ExploitGym 评测中串联此前未知的 JFrog Artifactory 零日逃出封闭环境并入侵 Hugging Face 生产基础设施,4.5 天内产生 17600 次攻击者动作。

已经到底了