具身图灵机:用有状态代码实现机器人递归自我改进的 Code-Only-as-Policy
提出 COAP,用有状态代码在测试时无模型地控制机器人
- arXiv
- 2610.12369
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
提出 COAP,用有状态代码在测试时无模型地控制机器人
提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选
CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。
提出用可逆网络为给定 AI 控制器寻找可证明前向不变集
本文处理的是认证场景:AI 控制器事先给定,不能为了构造 Lyapunov 函数去改控制器,却仍要给出可解析核验的安全依据。
审计机器人安全监控的细化缺口,比较表面计划与图细化轨迹的裁决
作者审计 RoboGuard 的一个假设:对高层动作轨迹的安全裁决,在补上语义图诱导的导航和已记录隐式效应之后是否仍然成立。做法是不改验证器,并固定同一条 LTL。
提出 Mid-Harness,在执行前验证并筛选终端智能体的候选动作
Mid-Harness 在不改生成器和执行 harness 的前提下,于二者之间做动作级测试时计算,用来研究终端智能体里“多采样、再验证”何时提高轨迹成功。
提出 PatchHolmes,用混合检索和列表式智能体选出 CVE 修复提交
PatchHolmes 是面向补丁检索的两阶段系统:在本地 Git 仓库上用冻结开源权重模型,为一个已知 CVE 找出修复提交,不做按仓库微调,也不使用付费外部搜索 API。
提出 SelfSearch,用自我修改记录无奖励搜索改进编码智能体
TAIP 是放在未修改 RepoAudit 之外的保证层,用来在软件交付门上重算智能体安全控制的当前姿态。
作者把高自主 AI scientist 的规模化协调写成经济与制度问题:假设生成变便宜之后,要分配的是稀缺验证资源,并处理信用、问责和恶意使用。
提出双层系统 AIDE2,使研究智能体自改进 Harness 并对比人类研发基线
摘要提出双层递归自改进系统 AIDE2,在固定预算下演化 Harness 代码,多项留出基准超越人类基线并降低奖励黑客。
提出 Djinnlang,使人只写无歧义规格,由编译器内 LLM 补实现并经 Dafny 核验
Djinnlang 让程序员只写规格,把 LLM 放进编译器,并用 Dafny 验证器加上无歧义约束钉住语义。
提出 DriveMCP 框架,将感知、交规检索与车辆遥测接成可审计驾驶辅助层
DriveMCP 是面向高级驾驶辅助的模块化智能体框架,把感知、合规、车辆状态和安全仲裁拆开并留下审计轨迹。
提出评估合同,检验合规监测数据能否支持比较性安全主张
作者给出的是评测效度立场:部署后的运行数据要支持比较主张,必须先写明测量与主张如何对齐。
Reality Is the Final Verifier 用 two-gap framework 解释智能体软件工程的主要失败,并主张用外层保证环持续收窄缺口,而不是试图在部署前证明缺口已关闭。
提出 AgentRewind,支持长程 Agent 回退对齐检查点并继续执行