研究团队用 LLM 分析 570 万条 Reddit 帖,构建 AI 危害分类体系
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
- arXiv
- 2610.09082
- 发表
- 层
- 应用层
- 场景
- 模型与 API
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
另有 277 篇论文还没打上分类标签,暂不在筛选结果里。
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
摘要书评认为形成中的架构由多类行动者塑造,但没有共同计划。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 OSWorld-Science 基准,评测计算机使用智能体完成科学软件工作流的能力
提出 EngiWorld 基准,评测 Agent 在专业工程软件中走完设计闭环的能力
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
形式化视频透视头显中系统截图与人眼视野的错配
测量间接提示注入对类型化概率决策的动作劫持
作者在 jev-1.13.0 上研究 decision hijacking:不可信内容能否在用户任务和可选动作都不变时,把类型化决策推向攻击者目标。
提出 OSWorld-Pro,用顺序子目标过程评测计算机使用智能体
OSWorld-Pro 是一套计算机使用智能体的过程评测,用来补充只核对最终交付物的 OSWorld。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出 HazardAuditor,用可执行轨迹训练计算机使用 Agent 的运行时守卫
主题分析青少年相关 Reddit 帖子,归纳陪伴 AI 过度依赖与感知互惠
Namvarpour、Chang 与 Razi 用计算辅助主题分析,描述青少年相关 Reddit 讨论中与 AI 陪伴聊天机器人的关系及潜在过度依赖。
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 SCOPE,联合后训练计算机使用智能体的任务能力与安全决策
对照印度消费者保护法分析 AI 产品伤害的归责缺口
Kumar、Sridhar、Mithal 与 Ravindran 的工作论文检查,印度消费者保护成文法能否处理面向消费者的 AI 伤害。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。