具身图灵机:用有状态代码实现机器人递归自我改进的 Code-Only-as-Policy
提出 COAP,用有状态代码在测试时无模型地控制机器人
- arXiv
- 2610.12369
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
另有 241 篇论文还没打上分类标签,暂不在筛选结果里。
提出 COAP,用有状态代码在测试时无模型地控制机器人
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
提出 Secure-CUA,用动作事务约束计算机使用智能体的不可信影响
Secure-CUA 要限制图形界面里不可信内容对 CUA 决策和 GUI 执行的影响,同时保留合法任务所需的不可信信息。
提出 WebMirage,用局部对抗图像劫持视觉网页 Agent 的浏览器操作
WebMirage 是一个面向视觉定位网络智能体的流水线感知端到端红队攻击框架。
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 CredLeak-Bench,评测 Agent 面对钓鱼的凭据泄露与恢复
提出 Inspect Robots,在真实机器人上评测具身模型的能力与拒答
构建 AGENTDOXX 基准,评测联网搜索 Agent 对匿名访谈的再识别
摘要论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
提出 CrashSim 用真实事故先验引导扩散仿真并构建 nuCrash 评测自动驾驶规划器
CrashSim 用检索到的真实事故先验引导扩散式多车仿真,为自动驾驶安全评测生成碰撞与近碰撞场景。。
构建网页浏览 Agent 的多语言多模态压力测试基准 HyperBrowseComp
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
提出 Control OSWorld,评测失准 GUI Agent 的监控
提出 COBRA 双 LLM 架构,防御计算机使用 Agent 的分支转向攻击
摘要提出分支转向防御架构 COBRA,通过事前能力约束与边界代理消除分支转向攻击并兼顾效用。
提出 ZoneClaw,用记忆分区防御计算机使用 Agent 的持久记忆攻击
提出 OSWorld-Science 基准,评测计算机使用智能体完成科学软件工作流的能力
提出 DrivingBench,评测通用视觉语言模型能否闭环驾驶真车
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
提出 EngiWorld 基准,评测 Agent 在专业工程软件中走完设计闭环的能力
用 DIBench 评测移动 GUI 智能体被 UI 注入后的决策完整性
摘要论文提出移动智能体决策完整性基准 DIBench,发现欺诈 UI 注入诱导目标选择并推高完成率,通用防御收益不稳定。
提出 Veer,在网页 Agent 执行前改写会造成未授权后果的网页状态