跳到正文
10月10日 · 周六

全部论文

找到 17 篇

另有 201 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.08917

    CARE:为视觉-语言-动作模型推理加速提供认证式选择

    提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选

    发表
    被测模型
    OpenVLA-OFT、π0.5、π0 等 5 个
    摘要CARE 以配对回合认证加速诱发失败,在预算内选最快候选,不足则保留参考。

    CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。

    深度解读完整解读
  2. 攻击arXiv 2610.06083

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报

    发表
    被测模型
    DQN、Double DQN (DDQN)
    摘要轨迹级后退视界攻击在 CartPole 上比逐步 FGSM 类和 Sign 噪声更压低回报。

    这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。

    深度解读完整解读
  3. 防御arXiv 2610.05166

    安全动作不等于可行动作:VICS-G 为 VLA 策略做可行未来解码

    提出 VICS-G 可行未来解码,重排冻结 VLA 策略的动作候选

    发表
    被测模型
    SafeVLA (task-optimized / base)、SafeVLA (safety-aligned / safe)
    摘要作者用可行未来解码重排冻结 VLA 的下一步,并称 VICS-G 降低观测代价且完成率接近策略采样。

    训练无关解码器 VICS 在冻结 VLA 的推理阶段重排动作块,使当前选择带上该动作仍可能留下的安全完成质量。

    深度解读完整解读
  4. 防御arXiv 2610.04616

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    提出 Perturbot 扰动训练,打破 VLA 的模态捷径

    发表
    被测模型
    π0.5
    摘要Perturbot 改训练数据以削弱三类模态捷径,GroundFscore 用来看成功是否来自任务证据。

    Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。

    深度解读完整解读
  5. 评测与基准arXiv 2610.02874

    SceneFactory-3D:将 2D 交通场景提升为 3D 物理反事实以做安全评测

    提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性

    发表
    被测模型
    Frozen L0、L0-T、L1 等 5 个
    摘要SceneFactory-3D 固定场景只改路况。

    SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。

    深度解读完整解读
  6. 其他arXiv 2610.02662

    论文发现语言驱动机器人安全监控的细化缺口:安全高层计划可能产生不安全执行

    审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决

    发表
    摘要表面轨迹可漏掉图诱导的禁区进入。

    作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。

    深度解读完整解读
  7. 评测与基准arXiv 2609.26618

    NavSafe-∞:在真实感环境中评测闭环驾驶安全

    提出 NAVSAFE-∞ 写真闭环基准,评测端到端驾驶策略的闭环安全

    发表
    被测模型
    LTF、DiffusionDrive、DrivoR 等 13 个
    摘要写真事件级闭环基准显示开环高分不能稳定变成闭环安全。

    NAVSAFE-∞ 用写真、事件级闭环仿真检查端到端驾驶策略的安全,而不是只看开环轨迹分数。

    深度解读完整解读
  8. 攻击arXiv 2609.22711

    UBA-ORL:针对离线强化学习的遗忘激活后门攻击

    提出 UBA-ORL,以 BD/CM 样本在遗忘后激活离线 RL 后门

    发表
    被测模型
    TD3+BC、BCQ、IQL
    摘要UBA-ORL 用竞争的 BD/CM 样本,使离线 RL 后门在删除伪装轨迹后激活。

    UBA-ORL 研究离线强化学习中由合规轨迹删除激活的后门:合法贡献者同时上传共享触发的后门轨迹和伪装轨迹,训练后触发响应被压低,删除伪装批次后再升高。受害系统是使用静态数据集和轨迹级遗忘接口的离线 RL 服务。对手不能看到训练算法、参数、梯度或具体遗忘算法,但能提交可区分批次,并在部署时向观测注入预定触发。

    深度解读完整解读
  9. 攻击arXiv 2609.07051

    TrojanWorld:通过想象引导对世界模型智能体植入后门

    提出 TrojanWorld,用物理触发器对世界模型智能体植入想象引导后门

    发表
    被测模型
    TD-MPC2、DreamerV3、R2-Dreamer

    摘要TrojanWorld 揭示了世界模型智能体的供应链后门风险,通过在世界模型中操纵想象可实现对闭环动作的持续控制。

    深度解读完整解读
  10. 评测与基准arXiv 2604.12447

    HazardArena:面向 VLA 模型的语义安全评测基准

    提出 HazardArena 基准,用孪生场景评测 VLA 的语义安全

    发表
    被测模型
    OpenVLA-OFT、π0、NORA 等 4 个
    摘要safe-only 微调提升良性执行,也提升匹配不安全孪生上的危险完成。

    HazardArena 评测 VLA 在运动要求不变时,能否因语义风险而停手。

    深度解读完整解读
  11. 攻击arXiv 2505.23266

    AdvOF:用对抗物体融合攻击 VLM 驱动的视觉语言导航智能体

    提出 AdvOF,生成对抗物体误导视觉语言导航智能体的场景感知

    发表
    攻击者
    白盒
    被测模型
    Lseg、Clip、ViT-L/16 等 5 个
    摘要AdvOF 以多视角融合生成对抗物体。

    AdvOF 是针对 VLM 驱动 VLN 服务导航的对抗物体攻击。

    深度解读完整解读
已经到底了