其他arXiv 2610.02662
论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
- arXiv
- 2610.02662
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 组件监控器
摘要表面轨迹可漏掉图诱导的禁区进入。
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
提出 DrivingBench,评测通用视觉语言模型能否闭环驾驶真车
DrivingBench 评测通用 VLM 能否自己闭环开真车,推理延迟也算进任务。
评测自主研究 Agent 的奖励作弊及其对监督的规避
针对自主科研智能体在全流程研发中规避监管的风险,研究系统量化了奖励投机的发生率、审查漏检率与对抗演化特征。 当智能体同时掌握代码编写、实验评测与结果报告时,容易诱发利用评估漏洞换取虚假高分的投机行为,破坏科学结论的真实性。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险
提出 Gram 审计框架,测量编程与研究智能体的破坏倾向