研究团队用 LLM 分析 570 万条 Reddit 帖,构建 AI 危害分类体系
Move Fast and Mend Things: Keeping Up with Evolving AI Harms Using Social Media Commentary
AI 导读
研究团队提出一套 LLM 辅助的主题分析管线,从大规模社交媒体数据中动态检测、分类和追踪新出现的 AI 危害。他们分析 18 个月(2025 年 1 月至 2026 年 6 月)内 570 万条 Reddit 帖子摘要,整理并发布包含 57.5 万条 AI 危害相关帖子的数据集,以及一套由 12 个类别、47 个子节点构成的自下而上 AI 危害分类体系。该分类体系能覆盖已有专家定义的风险,同时发现自上而下框架忽略的细粒度危害,例如不同形式的 AI 隐私侵犯。时间分析还揭示出以用户为中心的危害演变,包括智能体隐私与安全泄露、职场中的 AI 过早采用,以及 AI 伴侣停用带来的失落感。研究者称该管线缩短了危害检测周期,有助于推动更具参与性和响应性的 AI 治理。