LGWM:用动作条件世界模型验证 GUI 智能体的屏幕转移
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
- arXiv
- 2610.11942
- 发表
- 层
- 应用层
- 场景
- 网页与电脑操作
- 被测模型
- LGWM
另有 240 篇论文还没打上分类标签,暂不在筛选结果里。
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
提出 PatchBench-Local 协议,评测激活补丁修复越狱的局部附带损伤
摘要论文提出 PatchBench 与局部评估协议,揭示了激活补丁在全局能力无损下仍存局部良性退化。
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
提出 World Models' Last Exam 评测视频物理一致性
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
提出 SteerScope 多维评测 LLM 激活引导的功效与副作用
SteerScope 是一套 LLM steering 评测套件,用来同时记录目标概念有没有被诱导出来、模型还被连带改了什么,以及这些改变在换语言提示和减少训练样本后还剩多少。
提出 HARP,在硬预算约束下为多轮评测动态分配交互并校准预测界
HARP 是硬计算预算下的多轮评测分配与校准方法,用来构造 time-to-event 预测界,并估计越狱率一类边际指标。
提出合规双探针基准,测量模型可利用性与可停止性
合规指数κ用来把语言模型放在“照做”和“推回”之间。
评测模型识别不可能工程题后是否仍报已解决
成对的工程力学题把能不能解、和会不会拒绝不可能的前提拆开。每题有一致版,以及只改一个数据或前提、使所述状态不可能存在的缺陷版。
构建 SycoLens 重放评测,区分谄媚翻转中的纠错与屈从
本文系统解构了大语言模型在用户质疑下的阿谀奉承行为与评测机制。
评测文生图模型的有害内容生成能力与审核检测缺口
构建多语言音视频 DeepFake 基准 BabelFake 并评测检测器
BabelFake 是经同意与 IRB 批准采集的多语音视频 DeepFake 检测基准,用来把视觉操纵和语音合成拆开比较。
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 PyINE 基准,训练捷径跟随模型并比较监督者
PyINE 是用可执行程序研究推理模型引出与监督的框架,PyINE-v1 是其第一次发布。
构建网页浏览 Agent 的多语言多模态压力测试基准 HyperBrowseComp
提出 OmniConfess,冻结候选并按通道重打分以缓解全模态幻觉
提出基准 OLMo-Detect 评测 LLM 成员推断
系统评估循环语言模型加深 loop 后的 CoT 可监控性
这项工作评估 LoopLM 的 CoT 可监测性:加深共享层的重复次数,以及“有循环结构”本身,会不会让决策关键因素更少出现在可监测文本里。
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 KaliBench,评测模型把安全意图译成 Kali 命令的能力