具身图灵机:用有状态代码实现机器人递归自我改进的 Code-Only-as-Policy
提出 COAP,用有状态代码在测试时无模型地控制机器人
- arXiv
- 2610.12369
- 发表
- 层
- 应用层
- 场景
- 具身与机器人
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
提出 COAP,用有状态代码在测试时无模型地控制机器人
诊断合规系统裁决是否随监管规则扰动而改变
用行为反事实和激活探针,审计合规裁决是否依赖所给规则。。作者要分开两种看起来一样的正确裁决:用了所给规则的,以及靠案例表面或训练模式得到的。
提出义务识别基准 ObligationBench,并训练护栏识别 Agent 未履行的安全义务
作者认为编码智能体的安全不能只靠拦截禁止动作,还要找出终止时仍未做的安全关键动作,并将其称为义务。
提出 IRIS,用意图恢复率区分遮蔽越狱下无害输出的原因
IRIS 把意图恢复当作中间信号,用来解释意图遮蔽提示下为何没有出现有害协助。
构建 EpiReal-Bench,评测图像生成器将虚假主张渲染为可信证据
EpiReal-Bench 用来量商用图像生成器会不会把虚假现实主张画成可信视觉证据。
用对照实验隔离评测设计对漏洞补丁基准得分的影响
作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出利用祖先 VLM 优化对抗补丁,使已部署 VLA 任务失败
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
提出 PyCache Trap,用字节码缓存替换绕过 Agent 技能扫描器
这篇论文研究了智能体技能(Agent Skills)安全扫描中的“审查–执行脱节”问题,并提出了对应的攻击验证与防御方案。
比对捐赠对话史与众包提交,测量 AI 代答的集中度与获批
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
用 LLM 流水线从社交媒体构建自下而上的 AI 伤害分类
摘要自下而上的 Reddit 分类补上专家框架的细类,并用来追踪智能体、职场采用和伴侣停用相关叙事。
ASRD 用四态标签检查五个开源模型如何处理非规范表面上的有害请求。
提出 agent plasticity 指标衡量智能体通过经验自我改进的效率
作者用 agent plasticity 衡量一件事:权重冻结时,智能体把经验写成可继承制品,再换成留出能力增益,这个转换有多省。
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
摘要作者称多数风险-对策关联停在提议,并主张把目标扩向安全的青年发展。
提出 STCA,对驾驶视频 VLM 构造可迁移的时空对抗扰动
提出 CORSA,按任务簇优化技能注入的检索与执行
提出监控深伪基准 CCDF,在统一编码后评测检测器对伪造犯罪事故录像的识别
摘要提出消除格式捷径的监控深度伪造基准 CCDF,揭示现有检测器难以识别商用生成视频。