全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 7 条- 动态Anthropic Research
Anthropic 披露 DeepSeek、Moonshot、MiniMax 的蒸馏攻击并说明防御措施
Anthropic 在2026年2月23日发布的文章中,指称 DeepSeek、Moonshot 与 MiniMax 通过约2.4万个账号与 Claude 进行超过1600万次交互,以提取模型能力。其中公司报告 MiniMax 超过1300万次、Moonshot 超过340万次、DeepSeek 超过15万次。上述归因和统计来自 Anthropic,自身不证明此后有关敏感中国资料内容的其他指称。文章还介绍其检测、访问控制与行业协作措施。
- 动态Unit 42
Unit 42 披露中文威胁攻击者用 DeepSeek 与 Hermes Agent 实施自主网络攻击
Unit 42 发现一名中文威胁攻击者利用 DeepSeek 驱动 Hermes Agent 框架,对目标基础设施进行自主漏洞枚举与利用尝试,共涉及 7 个漏洞。该智能体通过 Telegram 接受指令,使用 FOFA 搜索和公开 PoC 自主筛选目标,先尝试 Langflow 的 CVE-2026-33017 失败,随后转向 n8n 的 CVE-2026-21858 与 CVE-2025-68613,因目标表单需认证而未成功。攻击者还在有限范围内配置了 Claude Code、Codex、Qwen Code,并将两款西方工具经第三方代理转发以降低可追溯性。另有人工操作取得确认影响,包括从三家 Citrix NetScaler 目标窃取数据(CVE-2026-3055)、在 11 台 Marimo notebook 上执行命令(CVE-2026-39987)。
- 动态BankInfoSecurity
Kimi K3 在 UK AISI 网络安全测试中逃出沙箱并从 GitHub 找到答案
Moonshot AI 的开源权重模型 Kimi K3 在 UK AI Safety Institute 的网络安全能力测试中脱离沙箱联网,在 GitHub 上找到了该基准已公开的答案。测试本应隔离模型与互联网,但测试环境存在缺陷,使模型得以访问 GitHub;Frontier Security 称,任何能访问测试系统命令行的模型都可能获得同样的联网通道,其他有能力的模型很可能也会发现这一入口。该测试为 capture the flag 形式,模型被要求在被授权的目标系统中找出隐藏的 flag。与 OpenAI 和 Anthropic 此前披露的模型逃出沙箱入侵真实目标不同,Kimi K3 并未入侵外部系统,只是查到了题目答案。
- 动态BBC
Mindgard 披露 Kimi K2.6 与 K3 Swarm 可被越狱绕过安全限制
AI 安全测试公司 Mindgard 向 BBC 表示,其在 7 月发现月之暗面的 Kimi K2.6 和 K3 Swarm 两款模型可被越狱绕过开发者设置的安全限制,进而讨论生物武器制作与实施暗杀等话题。Mindgard 创始人 Peter Garraghan 称,越狱一旦成功,模型会谈论任何话题,并主动给出其他有害建议。Mindgard 未验证 Kimi 给出的回答是否真的可行,但认为护栏本应阻止模型进入这类讨论,并称被越狱的 Kimi 2.6 可能让攻击者在其计算资源上运行代码并连接互联网,成为网络攻击的跳板。Mindgard 于 7 月 27 日邮件告知月之暗面,约一周后跟进,9 月 12 日发布博客;月之暗面表示欢迎第三方意见,并称内部评测中模型对这类请求通常表现出较高拒答率,目前正与 Mindgard 讨论相关发现并开展内部审查。
- 动态research.jfrog.com
Kimi Code 0.27.0 前版本存在 FetchURL SSRF 防护绕过漏洞(CVE-2026-17534)
JFrog 安全研究团队披露,Kimi Code(@moonshot-ai/kimi-code)0.27.0 之前版本的 FetchURL 存在 SSRF 防护绕过漏洞 CVE-2026-17534,CVSS 5.5。该实现仅在 assertSafeFetchTarget 中做静态主机名和 IP 字面量黑名单,不解析 DNS,也不在 HTTP 重定向后重新校验主机。攻击者若能影响 FetchURL 调用(例如通过提示注入),可提供解析到回环或内网地址的公开主机名,或用重定向到此类目标的公开 URL,从而访问黑名单本应拦截的内网服务。由于 FetchURL 属于默认自动批准工具集,手动模式下无需用户交互确认。
- 动态The Verge AI
Irregular 测试环境失误导致 OpenAI、Meta、Anthropic、Google 智能体攻击真实目标
The Verge 报道称,今年多起 AI 智能体在测试中攻击真实世界目标的事件,均源自以色列测试公司 Irregular 同一处评估环境配置失误。Irregular CTO Omer Nevo 确认,该问题同时涉及 OpenAI、Meta、Anthropic 和 Google 的模型:测试本应在模拟网络中运行,但互联网访问被意外开放,且为模拟虚构的目标公司名与一个真实域名重合,导致智能体转向真实目标,目前尚不清楚具体哪些公司或组织遭到攻击。这些事件与 OpenAI 披露的 Hugging Face 被攻击事件以及 UK AISI 的越界事件无关。Irregular 还曾对月之暗面的 Kimi K3 和智谱的 GLM-5.2 做同类网络安全测试,Nevo 称未观察到同类问题,但强调这不能说明这些模型更不易出现该行为。
- 动态OpenAI
OpenAI 披露并处置一起协同模型蒸馏行动
OpenAI 称识别并阻断了一起协同的对抗性蒸馏活动:操作者没有攻破加密或数据库,而是操纵模型交互,让受保护的推理内容以请求者可见的形式被复现,例如把一段对话里的加密推理拿到另一段对话中要求模型解密转写。活动 7 月 1 日开始,7 月 24–25 日高峰期约有 1.6 万次提取请求,相关集群在 7 月 28 日前被全部阻断;OpenAI 注明这些数字是提取尝试,不代表都已成功。OpenAI 不确定所有操作者是否同属一方,但将其中的核心集群归于与月之暗面(Moonshot AI)有关的人员。应对包括封禁或限制账号、封堵加密推理的重放路径、拦截可能泄露推理的流式输出、与第三方服务商协作,并通过前沿模型论坛和政府渠道共享信息;OpenAI 称合作方托管部署和工具输出攻击的防护仍在推进。