具身图灵机:用有状态代码实现机器人递归自我改进的 Code-Only-as-Policy
提出 COAP,用有状态代码在测试时无模型地控制机器人
- arXiv
- 2610.12369
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
另有 242 篇论文还没打上分类标签,暂不在筛选结果里。
提出 COAP,用有状态代码在测试时无模型地控制机器人
提出选项通道攻击,重命名选项标签使 Agent 护栏放行违规操作
摘要作者评估指出类型化模型不应作为最终安全裁决者,其易受非策略文本与选项名称操控,且置信度过滤无法抵御攻击。
用恐惧激活转向检验视觉语言模型的隐患判定准则
提出 LGWM,用动作条件世界模型核验 GUI 智能体屏幕转移
测量 AI 搜索引用脆弱性,证明普通公开发帖可进入引用与回答
摘要作者称论文量化了 AI 搜索因引用偏好与低发帖门槛形成的漏洞,测试显示公开网络发帖可渗透 AI 引用,呼吁审计引用供应链。
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
提出 LTBD,用可学习分隔符隔离可信指令与不可信数据
LTBD 是一种不改基座权重的提示注入防御:只学习用来标出可信指令与不可信数据边界的四个 token 嵌入。
构建统一奖励作弊检测基准 RH-Detect 并评测零样本检测器
提出 BRANCH 方法,用分支搜索绕过多扫描器护栏
提出 RSIGym 环境,评测研究智能体的递归自改进
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
提出热启动 Bandit 的部署前有界离线注入攻击
提出利用路由元数据推断敏感话题的侧信道攻击
摘要论文揭示并测量了 LLM 路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。
提出流匹配逆向框架,从多向量视觉文档索引重构页面
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。
提出 CARE 框架,在误分类风险约束下减少人机协作的人工查询
CARE 是面向人机协同二分类的端到端流水线,要在误分类风险不超过用户容忍的前提下减少人类查询。设定是 i.i.d.数据流、人类 oracle 标签正确、AI 为任意黑盒概率分类器。
提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选
CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。
提出 VeriFine,用双环协同扩展验证以实现具身推理自我改进
VeriFine 把驾驶和导航推理的自改进写成策略、课程和无参考评审的协同演化,用来处理固定评审跟不上新失败模式的问题。