研究团队用 LLM 分析 570 万条 Reddit 帖,构建 AI 危害分类体系
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
- arXiv
- 2610.09082
- 发表
- 层
- 应用层
- 场景
- 模型与 API
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 OSWorld-Science 基准,评测计算机使用智能体完成科学软件工作流的能力
提出 EngiWorld 基准,评测 Agent 在专业工程软件中走完设计闭环的能力
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 OSWorld-Pro,用顺序子目标过程评测计算机使用智能体
OSWorld-Pro 是一套计算机使用智能体的过程评测,用来补充只核对最终交付物的 OSWorld。
提出移动 Agent 轨迹审计器 MATE,判断轨迹是否违反可编辑安全策略
MATE 是面向移动 GUI 智能体的轻量策略条件轨迹审计器,在给定自然语言安全策略时判断轨迹是否违规并解释原因。
提出 ConflictGuard,引导 GUI Agent 在冲突指令下终止执行
ConflictGuard用推理时的可行性核验和条件激活转向,让 GUI 智能体在指令不可行时终止,而不是盲执行。
提出 SYNCHAIN,诱导计算机使用 Agent 自建跨任务持久攻击链
摘要论文揭示了 CUA 自合成工件带来的内部供应链威胁,验证了潜伏载荷的跨任务传播能力与防御局限。
提出 AgentHazard 基准,评测计算机使用智能体的执行层有害行为
AgentHazard 是针对计算机使用智能体执行层安全构建的评估基准,重点探究多步工具调用下局部合理动作累积引发的危害。