具身图灵机:用有状态代码实现机器人递归自我改进的 Code-Only-as-Policy
提出 COAP,用有状态代码在测试时无模型地控制机器人
- arXiv
- 2610.12369
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出 COAP,用有状态代码在测试时无模型地控制机器人
扩展全模态基座的强化学习以支撑智能体自我改进
MiMo-V2.6 是全模态 MoE 技术报告,用扩大 RL 计算、环境和评分来追求智能体自我改进。
比对捐赠对话史与众包提交,测量 AI 代答的集中度与获批
给出线性 robust bandits 特例的多项式时间学习者并证明小推广 NP-hard
这是一篇关于不可实现 bandit 学习之计算边界的理论工作:线性 robust bandits 的一个欧氏球仿射特例有多项式时间、Õ(√T)遗憾的学习者,再做小推广就会落到复杂性坍塌。
摘要作者称多数风险-对策关联停在提议,并主张把目标扩向安全的青年发展。
提出选择性长时程精炼,筛选轨迹以提升终端智能体训练可靠性
这项工作研究终端智能体模仿学习里,教师轨迹应保留多少 token。
提出任务感知的跨域蒸馏与剪枝方法以压缩音频深度伪造检测器
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
提出 TESS 与点值匹配损失,训练可迁移的数据选择网络
TESS 是一个用于 LLM 训练数据选择的元学习框架:用验证集引导下的损失差做样本伪标签,训练一个能给未见样本打分的选择网络。
摘要书评认为形成中的架构由多类行动者塑造,但没有共同计划。
提出 ExecCert,发布前核验机器遗忘候选是否落入预定可接受集
ExecCert 是放在遗忘生成器与发布门之间的认证层,用来检查具体有限精度产物是否满足预先声明的契约。
用均值场博弈分析多智能体集体攻击何时不是均衡
摘要结构阈值给出干预杠杆。
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
提出 SCAPO,用半事实稳定性改进 GRPO 的 token 级信用分配
SCAPO 把固定回答在半事实提示下的稳定性,变成 GRPO 训练早期的 token 级负向信用修正。。
提出 Mid-Harness,在执行前验证并筛选终端智能体的候选动作
Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。
提出 UNMERGE,用任务向量低秩分解做概念级遗忘
UNMERGE 把近似机器遗忘写成模型合并的逆运算:从已微调的合并任务向量里减去一个学出来的低秩遗忘分量。作者要处理的是概念级请求(一个类或一个语义组),而不是任意单条记录。梯度上升、重标注、蒸馏和显著性方法都靠把遗忘损失写进权重,作者认为它们超参脆弱、无法表达遗忘与保留的共享方向,也缺少逐层诊断。
提出 PatchHolmes,用混合检索和列表式智能体选出 CVE 修复提交
PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。
提出 SelfSearch,用自我修改记录无奖励搜索改进编码智能体
TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。
提出 QPT,用奖励与成本 Q 惩罚训练满足约束的离线强化学习策略
QPT 针对安全离线 RL:只从离线数据学习,同时处理约束满足、回报最大化和行为正则,并希望部署时更换成本阈值而无需重训。