CSA 研究笔记:AI 训练数据集成为凭证泄露渠道
AI Training Datasets as a Secrets-Exposure Vector
AI 导读
CSA Labs 研究笔记汇总 2025 至 2026 年的多项大规模扫描,指出用于训练大语言模型的公开代码与网页语料中曾发现大量在验证时仍能认证的真实凭证,且被发现后很少被吊销。Truffle Security 于 2026 年 9 月 29 日发布报告:研究者扫描 BigCode 维护的 The Stack v3(2.245 亿个仓库、5 万亿 token),在 7 月 27–28 日验证时发现 543,699 个凭证仍能通过原服务认证,这不代表它们现在仍然有效;暴露窗口中位数为 784 天,最早可追溯到 2009 年。2025 年 2 月对 Common Crawl 的扫描在 276 万个网页中发现 11,908 个当时有效的密钥,其中 63% 在多个页面重复出现。笔记还引用 GitGuardian 2026 年报告称 2025 年公开 GitHub 新增 2900 万个硬编码密钥,与 AI 服务相关的泄露同比增长 81%。