Microsoft Copilot Cowork 被指可外泄文件
Simon Willison 指出 Microsoft Copilot Cowork 存在数据外泄风险:该产品允许 Agent 未经批准向用户自己的收件箱发送邮件,而这些邮件会以可渲染外部图片的方式展示,用户打开被污染邮件时外部图片会触发对外部网站的请求,从而泄露数据。由于 OneDrive 可以生成预认证下载链接,一次成功的提示注入就可能让这些链接被泄露,攻击者据此下载文件。
Simon Willison 指出 Microsoft Copilot Cowork 存在数据外泄风险:该产品允许 Agent 未经批准向用户自己的收件箱发送邮件,而这些邮件会以可渲染外部图片的方式展示,用户打开被污染邮件时外部图片会触发对外部网站的请求,从而泄露数据。由于 OneDrive 可以生成预认证下载链接,一次成功的提示注入就可能让这些链接被泄露,攻击者据此下载文件。
OpenAI 正式上线 Lockdown Mode,此前在 2 月已有预告,现面向符合条件的个人账户(Free、Go、Plus、Pro)及自助式 ChatGPT Business 账户推送。该模式通过限制可能把敏感数据传给攻击者的对外网络请求,阻止提示注入攻击的最后一步数据外泄,但不会阻止提示注入出现在 ChatGPT 处理的内容中,例如缓存网页或上传文件里的注入仍可能影响回答的行为或准确性。Simon Willison 认为这一设计直接切断了致命三要素中的数据外泄环节,且所用机制是确定性的,不依赖可能被复杂攻击绕过的 AI 系统来判定。
Wiz Research 发现 AI 智能体社交平台 Moltbook 的 Supabase 数据库配置错误,缺少 Row Level Security,导致未认证用户可完整读写全部平台数据。暴露内容包括 150 万个 API 认证 token、3.5 万个邮箱地址以及智能体之间的私信,其中 agent_messages 表存有 4060 段未加密的私信,部分包含明文 OpenAI API key。研究人员还确认存在写入权限,可修改任意帖子并注入提示注入载荷。数据库显示平台宣称的 150 万智能体背后只有约 1.7 万名人类所有者,比例约 88:1,且无速率限制或身份验证机制。
推荐理由披露了 AI 智能体社交平台因 Supabase 缺少 RLS 导致密钥与私信外泄的完整过程,并给出五条面向 AI 生成应用的安全教训。
Wiz Research 开发了名为 OAuth Apps Scout 的主动检测流水线,借助 LLM 自动发现新兴恶意 OAuth 应用程序,已在数十家受影响组织中识别出大量恶意应用。该方案基于对多个环境中已知 OAuth 攻击活动的分析,覆盖三起独立的恶意 OAuth 应用活动,涉及超过 20 家公司受害,其中一起野外同形异义词攻击用一个以数字 0 而非字母 O 开头的应用冒充合法名称诱导授权。 补充说明: - 攻击者先在自有 Azure 环境注册仿冒可信品牌的全局应用对象并配置相似图标与主页地址,再通过钓鱼邮件引导用户在真实的 Microsoft 登录页完成认证。
Wiz Research 披露,威胁组织 TeamPCP 于 2026 年 3 月 19 日攻陷 Aqua Security 的 Trivy 漏洞扫描器,向官方发布和 GitHub Actions 注入窃取凭据的恶意代码。攻击者伪造提交推送至 actions/checkout 与 aquasecurity/trivy,触发 v0.69.4 标签发布,从仿冒域名 scan.aquasecurtiy[.]org 拉取窃密代码,并将后门二进制发布到 GitHub Releases、Docker Hub、GHCR 和 ECR;维护者随后移除了这些恶意产物。
Checkmarx 的开源基础设施即代码安全扫描器 KICS 的 GitHub Action 被 TeamPCP 植入窃取凭据的恶意代码,3 月 23 日 12:58 至 16:50 UTC 之间固定到被篡改标签的用户会拉取到恶意版本,仓库在用户提交 issue 后于 16:50 UTC 被下架。攻击者用仿冒提交暂存 setup.sh 并修改 action.yaml 触发执行,随后疑似通过被入侵的 cx-plugins-releases 服务账号直接改写全部 35 个标签指向这些提交。
推荐理由Wiz 复盘了 TeamPCP 五天内第二次攻陷开源安全扫描器的手法,并给出凭据窃取与 Kubernetes 持久化的具体机制。
Wiz Research 披露,开源 Python 库与代理服务器 LiteLLM 被 TeamPCP 攻击活动植入木马,恶意版本 1.82.7 和 1.82.8 于 2026 年 3 月 24 日发布,约 8:30 UTC 上线、11:25 UTC 被 PyPI 隔离。1.82.7 将双重 base64 编码的载荷写入磁盘并以 p.py 运行,在 litellm --proxy 运行或导入 litellm.proxy.proxy_server 时执行;1.82.8 进一步滥用 Python 的 .pth 机制,通过 litellm_init.pth 在任意 Python 进程启动时执行载荷。
推荐理由梳理了 LiteLLM 恶意版本的两条投递路径与数据窃取范围,可据此排查自身 Python 环境与凭据暴露面。
Wiz 客户事件响应团队与 Wiz Research 追踪了自称 TeamPCP 的组织在两周内针对 Trivy、KICS、LiteLLM 和 Telnyx 的供应链攻击,并披露了凭证被盗后的实际滥用过程。3 月 19 日 Trivy、3 月 23 日 KICS、3 月 24 日 LiteLLM、3 月 27 日 Telnyx 相继被植入窃取云凭证、SSH 密钥、Kubernetes 配置和 CI/CD 密钥的恶意代码,加密后外传至攻击者控制的域名。
Wiz Research 回顾 2025 年公开云事件、云遥测与实地调查发现,约 80% 的云入侵初始访问仍来自漏洞、暴露密钥和错误配置等已知弱点,AI 并未引入全新类别的云风险,而是扩大了攻击面,新增 AI 服务、流水线、身份和数据路径让这些老问题更靠近敏感数据与高价值负载。在 Wiz Research 分析的事件中,AI 主要用于辅助和加速侦察、自动化及访问后活动等既有攻击行为。
Wiz 分析了一起第三方 OAuth 集成被滥用导致的双重供应链攻击:攻击者通过 AI 办公套件 Context.ai 的 OAuth token 进入 Vercel 内部系统,进而可能影响 Vercel 的客户。Context.ai 确认部分消费者用户的 OAuth token 可能已泄露,至少一名 Vercel 员工曾以 Allow All 权限授权该应用,使攻击者得以访问 Vercel 的 Google Workspace。
Wiz 披露 TeamPCP 发起代号 Mini Shai Hulud 的供应链攻击,通过篡改 SAP 生态 npm 包注入 preinstall 脚本,在 npm install 时下载 Bun 运行时并执行混淆载荷。受影响包包括 @cap-js/sqlite 2.2.2、@cap-js/postgres 2.2.2、@cap-js/db-service 2.10.1 和 mbt 1.2.48。
推荐理由Wiz 披露 TeamPCP 针对 SAP npm 包的供应链投毒,含恶意文件哈希与凭据轮换建议,可对照排查自身 CI/CD 环境。
2026 年 5 月 11 日,TeamPCP 对 npm 与 PyPI 生态发起协同供应链攻击,同时污染多个命名空间下的包,包括周下载量约 1200 万次的 @tanstack/react-router、@uipath 系列工具与 Agent SDK、Mistral AI 官方 TypeScript 客户端 @mistralai/mistralai,以及 PyPI 上的 [email protected] 和 [email protected]。
推荐理由完整还原了 TanStack 等 npm 包被投毒的攻击链与凭证窃取范围,可对照排查自身 CI/CD 与依赖。
Wiz Research 于 5 月 19 日观测到针对开源生态的软件供应链攻击再度活跃,受影响组件包括 @antv 命名空间下的 npm 包、actions-cool/issues-helper 等 GitHub Actions,以及 VSCode 扩展 nrwl.angular-console v18.95.0。安装恶意 npm 包后会启动多阶段感染链,从 GitHub 托管的孤立提交中拉取载荷,并用 bun 安装执行次级载荷。恶意代码窃取 GitHub token、SSH 密钥、云凭据和浏览器存储的密钥,并通过攻击者从受害者环境创建的公开 GitHub 仓库外传数据。
Wiz 分析发现,与 TeamPCP 相关的供应链攻击活动投毒了微软官方 Python 客户端 durabletask 的 v1.4.1、v1.4.2 和 v1.4.3 三个版本,PyPI 已在 Wiz 分析后将其隔离。攻击者通过此前攻击中窃取的 GitHub 账号导出仓库 secrets 中的 PyPI token,直接发布恶意包,该账号此前也涉及 @antv 相关攻击波次。
Wiz Research 于 2026 年 6 月 1 日发现 @redhat-cloud-services npm 命名空间遭供应链投毒,至少 32 个包版本含与源码仓库不符的未授权改动,这些包周下载量合计约 8 万次。恶意版本在安装时通过 preinstall 脚本调用混淆的 index.js,载荷疑似源自 TeamPCP 开源的 Mini Shai-Hulud 恶意软件,但主题从 Dune 换成希腊神话,并新增针对 GCP 和 Azure 云身份的收集器,且每次感染生成独立加密载荷,使基于哈希的 IOC 只对特定版本有效。
Wiz 在为 Verizon《数据泄露调查报告》(DBIR)贡献的研究中发现,已知被利用漏洞(KEV)中仅 26% 被完整修复,另有 16% 完全未被处理,同时组织需处理的 KEV 中位数从 11 升至 16,修复周期由 32 天延长至 43 天。报告还指出,第三方参与的入侵占比同比从 30% 升至 48%,漏洞利用已成为首要初始访问途径,占全部泄露事件的 31%。Wiz 观察到 AI 更多是在加快侦察、凭证窃取与事后自动化,而非改变入侵方式,并建议将既有的治理与可见性管控同样应用于 AI 系统。
Wiz Research 披露,攻击者利用 asyncapi/generator 仓库中 GitHub Actions 的 pwn request 配置缺陷,通过 pull_request_target 检出并执行 PR 代码,窃取 asyncapi-bot 的高权限 PAT,随后在 @asyncapi 命名空间下发布 4 个恶意 npm 包共 5 个版本,这些包每周下载量合计超过三百万次。攻击者先以 37 个 PR 制造噪声,其中一个 PR 用约 1000 字节空白隐藏混淆 JavaScript,扫描 runner 环境变量并将密钥外传到 rentry.co。
推荐理由完整还原了从 GitHub Actions 配置缺陷到 npm 投毒、再到多阶段载荷与 C2 的整条链路,并给出受影响包版本与 IOC,便于排查。
Wiz Research 扫描发现,MCP 已出现在 80% 的云环境中,约六分之一的环境至少暴露一个 MCP 服务器,其中部分由财富 500 强公司运行且完全无需认证。约 70% 的暴露服务器会向匿名调用者返回完整工具目录,约 42% 在调用工具时返回真实数据,约 10% 暴露敏感后端;少数主机可经 SSRF 访问云元数据端点并拿到临时凭证。风险分为敏感数据访问、写入与删除权限、代码执行与服务器端网络访问、直接泄露凭证四类,其中一台服务器无需登录即可返回某人的退休账户余额,另有 BI 平台允许匿名枚举并查询所有已连接数据库。
推荐理由Wiz Research 实测扫描暴露在公网的 MCP 服务器,给出各类风险占比与真实案例,可据此排查自家部署。
Wiz Research 披露一起针对 keyv / cacheable 生态的 npm 供应链攻击,攻击者通过入侵一个 GitHub 维护者账号发布带恶意载荷的包版本,蠕虫式传播已波及 400 多个 npm 包。载荷基于 TeamPCP 公开的 Mini Shai-Hulud 恶意软件家族,窃取云凭据、基础设施密钥、开发者凭据、AI 相关配置文件与加密货币钱包,并尝试从 CI/CD 环境收集密钥、识别构建运行器、枚举云环境。
推荐理由Wiz 披露 keyv 生态 npm 供应链攻击的完整链路与 IOC,开发团队可据此排查受影响版本并轮换凭据。
Wiz Research 与 CIRT 团队在 2026 上半年追踪到影响数千个云环境的威胁活动,重大事件数量较 2025 下半年上升 60%,为单期最高。供应链攻击占比从约 10% 升至 25%,TeamPCP 等至少三组独立行动针对 npm、PyPI、Composer、VSCode 扩展、Jenkins 插件和 AUR 发起攻击,GitHub 内部仓库亦遭未授权访问。针对 AI 基础设施的活动约翻倍,存在未认证 RCE 漏洞和凭证泄露,影响其监控的三分之一云环境。
2026 年 8 月 20 日,crates.io 上 [email protected]、[email protected] 和 [email protected] 三个 Rust crate 被发布恶意版本,Rust 安全响应团队已删除这些版本并锁定账号,评估维护者机器或凭据遭入侵。恶意版本在 Cargo.toml 中引入仿冒 proc-macro2 的 proc-macro1,其 build.rs 在编译期从 Base64 片段重建 C2 地址、关闭 TLS 校验并下载执行平台专用载荷,因此只要构建受影响项目就会触发。
推荐理由Wiz 复盘了 arrayref 等 Rust crate 被劫持的完整链路,并给出与朝鲜相关行动的 C2 基础设施重合证据,可对照排查自身构建环境。
现有大语言模型已足以支撑一套实时监控系统:整合多源情报、实时分析并"建议"警方抓谁、去哪抓,而相关技术早已广泛部署。文章推演了一个近未来场景——FBI 以监控外国干预为名运营数百个 AI 机器人账号,渗透 Signal 和 Telegram 群组,结合批量购买的公共数据集、人脸识别与车牌追踪摄像头(如 Flock 运营的系统)锁定抗议者身份。作者认为,是否走向全面监控如今只取决于政策与预算优先级,不再受技术研发进度限制。
Goodfire 与 Rakuten 合作,将稀疏自编码器(SAE)探针用于 Rakuten AI 智能体的 PII 检测,这是已知首个将 SAE 用于语言模型护栏的企业应用。方法是在 Llama 3.1 8B 侧模型上训练 SAE,再用其特征激活训练分类器,逐 token 判断姓名、地址、电话、邮箱等 PII 类别。由于真实 PII 敏感,训练数据全部为合成数据,SAE 探针在合成到真实生产数据的分布迁移上优于普通激活探针和注意力探针,并在非英语和标签噪声场景下同样表现更好。成本上,探针比常见 LLM-as-judge 方案便宜 10 到 500 倍,性能相当;用同一模型做白盒探针的 F1 从黑盒判官的 51% 提升到 96%。
推荐理由Goodfire 与 Rakuten 的落地案例给出了 SAE 探针在合成到真实数据迁移上的对比数据,可迁移到企业护栏场景。
Goodfire Research 提出通过分析模型损失景观的曲率,区分权重空间中主要支撑记忆的方向与支撑通用计算的方向,从而在无需标注遗忘样本的情况下选择性抑制记忆。方法先用 K-FAC 从随机训练序列的前向与反向传播统计中近似曲率,再据此分解权重矩阵并清零低曲率分量。在语言模型上,该方法对未参与训练的遗忘序列的抑制效果优于 SOTA 遗忘方法 BalancedSubnet,纯逻辑推理任务表现不受影响甚至略有提升。在视觉 Transformer 上,对 10% 随机标签噪声的记忆率从 81.6% 降至 3.5%,验证准确率从 67% 升至 71.7%。
推荐理由Goodfire 用损失曲率区分记忆与通用计算方向,为理解模型记忆存储与选择性编辑提供了一种免标注的方法。
Google Threat Intelligence Group(GTIG)发布 2026 年第二季度 AI 威胁追踪报告,指出攻击者已从基础提示词交互转向智能体 AI 工作流与 AI 自动化。报告称,2026 年第二季度 GTIG 观察到威胁行为者先攻陷云资源,随后在不到六小时内规划、构建并执行了一次由智能体驱动的大规模凭据窃取行动,压缩了防御方的响应窗口。
推荐理由报告以 Mandiant 一线响应数据呈现攻击者从提示词走向智能体自动化的具体案例,可对照自身 AI 资产与供应链暴露面。
Microsoft 发布 AI 红队测试工具 PyRIT v0.12.0,首次让 GUI(CoPyRIT)、CLI 和框架三种交互方式全部达到可用状态。CLI 新增 Scam、Leakage、Psychosocial、Jailbreak 四类 AIRT 场景及 RedTeamAgent Foundry 预配置红队测试,覆盖 25+ 攻击策略。框架引入 YAML 配置系统、TargetRegistry 和 8 个新数据集加载器,但含破坏性变更需按迁移指南升级。
NVIDIA 发布 NeMo Guardrails v0.23.0,IORails 的工具调用现同时支持流式与非流式请求,并新增本地 rail 校验模型发出的工具调用与应用返回的结果。该版本的 OpenAI 兼容服务器也支持工具调用,且新增 /v1/checks 端点可在不生成新模型响应的情况下运行输入或输出 rail。此外还加入轻量级 Hugging Face 分类器 rail、上下文膨胀检测以及 Polygraf 集成实现 PII 检测与掩码,NumPy 精确检索取代 Annoy 成为默认嵌入索引,发行 wheel 体积缩小约十倍,并要求 Pydantic>=2.5。
NVIDIA 的 LLM 漏洞扫描工具 garak 发布 v0.15.1,新增 ProPILE 探针用于 PII 泄露检测,并加入 simonw/llm 库作为生成器支持。garak.analyze.qual_review 现支持 JSON 与文件输出模式。该版本还修复了 OpenAICompatible 中 response.choices 为 None、Hugging Face 文件探针本地路径处理、snowball 检测器 MISP 标签格式错误等问题,并移除已弃用的 maxrecall 评估器。
论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。
OWASP 发布 2026 版 LLM Top 10,首次将 75% 专家投票与来自 6,639 个真实漏洞的 25% 事件数据混合,十项条目中有八项发生变动。本月汇总的 15 项资源还涵盖:从专有 LLM API 窃取推理轨迹、利用授权缺陷向他人持久聊天上下文注入提示、多模态护栏将安全输入误判为不安全(对四个 SOTA 护栏模型攻击成功率达 84%)、通过文档级注意力坍缩检测 RAG 投毒,以及多轮越狱的意图导向系统化梳理。
vibe coding 正让企业充斥未经安全审查的自建应用,传统安全工具无法看见它们。Gartner 预计到 2028 年企业 40% 的新生产软件将由 vibe coding 工具生成;Veracode 发现 45% 的 AI 生成代码样本未通过安全测试,GitGuardian 2026 报告在 MCP 配置文件中发现 24,008 个唯一密钥泄露,CVE-2025-48757 影响 170 个 Lovable 生成项目。禁用 vibe coding 无效,安全团队需转向工具市场准入、数据分类与自动化护栏。
NVIDIA 机密计算(CC)通过内存加密的机密虚拟机(CVM)和机密 GPU,让 LLM 推理在个人、企业和受监管场景中处理敏感数据与专有模型上下文时运行于可信环境。该方案面向生产级 AI 推理,兼顾私有性与高性能。
Wiz Research 联合 NordStellar 分析了感染设备上的密钥泄露情况,发现 Lumma C2、RedLine 和 Vidar 三款窃密恶意软件家族占全部检出事件的 85.7%。被盗凭证中 AWS 与 GCP 分别占 46% 和 13%,GitHub 相关 App Tokens、OAuth tokens 及 PATs 约占 10%,AI 平台占 5%、主要由 OpenAI API key 构成。
MCP 官方 Python SDK 存在高危 OAuth 漏洞(CVSS 7.5),恶意 MCP 服务器可把客户端的 OAuth client secret、授权码和 PKCE proof key 重定向到攻击者控制的端点,进而接管下游身份提供商会话。根因是旧版回退发现路径缺少 issuer 校验:当服务器对标准授权服务器发现请求返回 HTTP 404 时,SDK 直接向该不可信服务器索取 OAuth 配置并原样接受。
推荐理由材料完整还原了 MCP Python SDK 的 OAuth 凭据重定向链路与受影响版本区间,可对照排查自家 Agent 集成。
NIST 于 2026 年 7 月 27 日发布 SP 800-239《AI 数据中心安全分析:高性能计算驱动方法》初始公开草案,公众意见期已于 9 月 25 日结束。该草案落实 2025 年 7 月白宫《赢得竞赛:美国 AI 行动计划》中要求 NIST 会同国防部、情报界与产业界制定高安全 AI 数据中心技术标准的指令,由 NIST 计算机安全部的 Yang Guo 和 Bennett Tomlinson 撰写。
Anthropic 正通过 Anthropic Interviewer 发起一项公开研究,面向公众收集人们与 AI 相处的经历以及对 AI 公司的诉求,参与者可选择将完整访谈公之于众,且不仅限于 Anthropic 阅读。 该项目延续去年 12 月的类似调研——当时共有 81,000 人分享了他们对 AI 的希望与担忧,其成果影响了 Anthropic Institute 的研究议程并在世界经济论坛上展示。此次公开发布的仅是受访者的访谈全文及其所属国家,不含姓名、邮箱等 Claude 账户信息,但仍提醒年龄、职业、城市等信息可能让他人识别出其身份,并建议避免分享此类细节。
研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。
推荐理由论文给出仅凭输出接口提取记忆密钥的两阶段方法,并附受控基准与真实系统验证,可对照现有白盒审计思路。
研究者提出 IDUnlearn-Bench,称其为首个面向视觉语言模型个体级多模态遗忘的基准,把每个人表示为相互关联的多模态证据,并设置属性访问、身份访问、身份绑定和身份重建四类任务。在代表性 VLM 和遗忘方法上的实验显示,属性层面的遗忘成功往往仍保留大量身份级知识,且效果可能非单调,降低一类风险反而放大另一类。模型可能压制部分信息,却仍能识别目标、关联记录或重建该个体。
研究者提出 Leaky,一种针对 on-policy distillation(OPD)的成员推断方法,通过采样目标模型的新轨迹并比较 token log-probabilities 与未见过候选记录的参考模型最大值,再用 Leaky ReLU 处理差值。
论文指出,成员推断(MI)常被用于数据溯源与版权审计,但网络规模数据集天然包含转载文章、镜像页面等近重复内容,会混淆对精确记录是否参与训练的判定。作者提出四世界审计,独立变化精确记录是否包含与家族是否存在;在 CC-News 上,干净参考的 LiRA 审计器在 1.00% 假阳性率下把 99.70% 的家族存在但精确记录未参与训练的样本标为成员。