其他arXiv 2610.02662
论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
- arXiv
- 2610.02662
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
- 组件监控器
摘要表面轨迹可漏掉图诱导的禁区进入。
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
访谈残障成人,分析向记忆型助手披露残障时的信息流与语境完整性
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。
提出 S³,用 guard agent 编排阶段安全技能防御智能体多阶段风险