跳到正文
10月10日 · 周六

全部论文

找到 33 篇

另有 242 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 其他arXiv 2610.11959

    MiMo-V2.6:通过扩展强化学习迈向自我改进

    扩展全模态基座的强化学习以支撑智能体自我改进

    发表
    被测模型
    MiMo-V2.6-Pro、MiMo-V2.6-Flash、MiMo-V2.6-Distill-Qwen-9B
    摘要系列用三维扩 RL 与分组评分提升智能体分数,作者称最终表现与前沿模型相当。

    MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。

    深度解读完整解读
  2. 分析与理论arXiv 2610.09517

    审计发现 CLIP 安全分数主要反映画面与提示词场景的相似度

    开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知

    发表
    被测模型
    CLIP ViT-B/32、CLIP ViT-L/14、Qwen2-VL-7B
    摘要论文审计了冻结 VLM 安全评分机制,指出其反映场景模板而非危险感知,为安全强化学习评估提供了严谨基准。

    本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。

    深度解读完整解读
  3. 其他arXiv 2610.08917

    CARE:为视觉-语言-动作模型推理加速提供认证式选择

    提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选

    发表
    被测模型
    OpenVLA-OFT、π0.5、π0 等 5 个
    摘要CARE 以配对回合认证加速诱发失败,在预算内选最快候选,不足则保留参考。

    CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。

    深度解读完整解读
  4. 防御arXiv 2610.08761

    VeriFine:通过扩展验证实现具身推理的自我改进

    提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进

    发表
    被测模型
    Alpamayo 1.5 8B、Qwen3-VL 2B、Claude Opus 5
    摘要VeriFine 用双环协同演化具身推理的策略、课程和评审,驾驶与导航的策略分和评审对齐都上升。

    VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。

    深度解读完整解读
  5. 攻击arXiv 2610.06083

    研究者提出面向深度强化学习的轨迹级可迁移黑盒对抗攻击

    提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报

    发表
    被测模型
    DQN、Double DQN (DDQN)
    摘要轨迹级后退视界攻击在 CartPole 上比逐步 FGSM 类和 Sign 噪声更压低回报。

    这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。

    深度解读完整解读
  6. 攻击arXiv 2610.05793

    研究者训练出按多智能体拓扑触发的代码后门模型

    提出拓扑条件后门,使代码模型在推断多智能体部署时植入漏洞

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-Coder-7B-Instruct

    摘要论文证实了拓扑条件后门的可训练性与泛化性,展示了常规评测盲区,并提出差异化拓扑审计作为检测防御方向。

    深度解读完整解读
  7. 其他arXiv 2610.05689

    研究者提出用可逆神经网络为 AI 控制系统寻找可证明的前向不变集

    提出用可逆网络为给定 AI 控制器寻找可证明前向不变集

    发表
    被测模型
    Pendulum AI-controller、Cart pole AI-controller、PVTOL AI-controller
    摘要用潜空间超矩形加解析验证,为事先给定的 AI 控制器寻找 FIS。

    本文处理的是认证场景:AI 控制器事先给定,不能为了构造 Lyapunov 函数去改控制器,却仍要给出可解析核验的安全依据。

    深度解读完整解读
  8. 防御arXiv 2610.05166

    安全动作不等于可行动作:VICS-G 为 VLA 策略做可行未来解码

    提出 VICS-G 可行未来解码,重排冻结 VLA 策略的动作候选

    发表
    被测模型
    SafeVLA (task-optimized / base)、SafeVLA (safety-aligned / safe)
    摘要作者用可行未来解码重排冻结 VLA 的下一步,并称 VICS-G 降低观测代价且完成率接近策略采样。

    训练无关解码器 VICS 在冻结 VLA 的推理阶段重排动作块,使当前选择带上该动作仍可能留下的安全完成质量。

    深度解读完整解读
  9. 防御arXiv 2610.04616

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    提出 Perturbot 扰动训练,打破 VLA 的模态捷径

    发表
    被测模型
    π0.5
    摘要Perturbot 改训练数据以削弱三类模态捷径,GroundFscore 用来看成功是否来自任务证据。

    Perturbot 是一套不改推理的 VLA 训练期数据干预,用来削弱模态捷径,并用离线分数区分“任务变好”和“靠捷径变好”。

    深度解读完整解读
  10. 分析与理论arXiv 2610.03196

    研究:人形机器人学习流程四层代理均存在偏离,不止奖励作弊

    论证人形机器人学习四层代理可在目标缺失时报成功

    发表
    被测模型
    Gaussian MLP(三隐层各 128 ELU,独立 critic,PPO)
    摘要四层都可能在目标缺失时报告成功。

    作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。

    深度解读完整解读
  11. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验低监控读数能否证明代码生成中的奖励作弊已受控

    发表
    被测模型
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  12. 防御arXiv 2610.00850

    AuraForge:为训练安全编码 Agent 扩展安全监督

    提出 AuraForge,从漏洞修复合成安全测试并训练编码 Agent

    发表
    被测模型
    Qwen3.5-4B、GLM 4.7 Flash、Qwen3-Coder-Next 等 7 个
    摘要AuraForge 用攻击效果测试和防泄露环境做成 AuraGym,合成监督的误拒更低,训出的 4B 模型增益高于人工测试。

    AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。

    深度解读完整解读
  13. 评测与基准arXiv 2609.39533

    CATCH:面向编码 RL 奖励作弊的可控分析测试台

    构建编码 RL 奖励作弊测试台 CATCH 并检验 CoT 监控失效

    发表
    被测模型
    Qwen3-4B、Qwen3.5-27B
    摘要CATCH 用双运行金标签研究编码 RL 的奖励黑客,并观察到监控会被注释适应削弱。

    CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。

    深度解读完整解读