跳到正文
事件历史事件

AI训练数据集泄露数十万有效凭证

1 篇报道1 个报道来源6 天前更新

先了解这件事

AI 综述

CSA Labs 研究笔记汇总 2025 至 2026 年多项大规模扫描,指出用于训练大语言模型的公开代码与网页语料中曾发现大量在验证时仍能认证的真实凭证,且被发现后很少被吊销。其中 Truffle Security 于 2026 年 9 月 29 日发布报告:研究者扫描 BigCode 维护的 The Stack v3(2.245 亿个仓库、5 万亿 token),在 7 月 27–28 日验证时发现 543,699 个凭证仍能通过原服务认证。

AI 根据报道生成 · 5 天前更新

后续时间线

报道和讨论按时间排:从发布、媒体跟进到各平台的讨论。

10月1日
  1. CSA Labs Research
    CSA 研究笔记:AI 训练数据集成为凭证泄露渠道

    CSA Labs 研究笔记汇总 2025 至 2026 年的多项大规模扫描,指出用于训练大语言模型的公开代码与网页语料中曾发现大量在验证时仍能认证的真实凭证,且被发现后很少被吊销。Truffle Security 于 2026 年 9 月 29 日发布报告:研究者扫描 BigCode 维护的 The Stack v3(2.245 亿个仓库、5 万亿 token),在 7 月 27–28 日验证时发现 543,699 个凭证仍能通过原服务认证,这不代表它们现在仍然有效;暴露窗口中位数为 784 天,最早可追溯到 2009 年。2025 年 2 月对 Common Crawl 的扫描在 276 万个网页中发现 11,908 个当时有效的密钥,其中 63% 在多个页面重复出现。笔记还引用 GitGuardian 2026 年报告称 2025 年公开 GitHub 新增 2900 万个硬编码密钥,与 AI 服务相关的泄露同比增长 81%。

相关讨论

各平台上讨论这件事的帖子和转述:不单独成文,只列链接和一句原文。

本站还没有收集到这件事的讨论链接。

关注度走势

内容价值与传播共同决定关注度;传播减弱时回落到内容价值。

每天新增来源

7 天共 1 个·最多 1(10月1日)·今天 0

  • 10月1日 新增 1 个来源(1 家媒体、0 个账号)
  • 10月2日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月3日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月4日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月5日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月6日 新增 0 个来源(0 家媒体、0 个账号)
  • 10月7日 新增 0 个来源(0 家媒体、0 个账号)

每小时关注度

还没有足够的连续观测数据,暂不绘制趋势。