评测与基准arXiv 2610.09082
研究团队用 LLM 分析 570 万条 Reddit 帖,构建 AI 危害分类体系
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
- arXiv
- 2610.09082
- 发表
- 层
- 应用层
- 场景
- 模型与 API
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
摘要书评认为形成中的架构由多类行动者塑造,但没有共同计划。
形式化视频透视头显中系统截图与人眼视野的错配
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
主题分析青少年相关 Reddit 帖子,归纳陪伴 AI 过度依赖与感知互惠
Namvarpour、Chang 与 Razi 用计算辅助主题分析,描述青少年相关 Reddit 讨论中与 AI 陪伴聊天机器人的关系及潜在过度依赖。
对照印度消费者保护法分析 AI 产品伤害的归责缺口
Kumar、Sridhar、Mithal 与 Ravindran 的工作论文检查,印度消费者保护成文法能否处理面向消费者的 AI 伤害。