仅凭输出审查无法验证什么:面向研究智能体的研究契约
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
- arXiv
- 2610.11754
- 发表
- 层
- 应用层
- 被测模型
- OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra、OpenAI gpt-5.6-luna 等 18 个
摘要研究合同暴露四类输出单独建不立的关系。
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
另有 194 篇论文还没打上分类标签,暂不在筛选结果里。
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
用对照实验隔离评测设计对漏洞补丁基准得分的影响
作者把 LLM 漏洞补丁基准的评测流水线当作会改变测量结果的对象,并明确说本文不是再做一个用于排名的基准。
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
测量工具调用 Agent 对显式报错与静默损坏的检测和恢复
作者在 BFCL 多轮可执行环境上注入一次工具层故障,把注意到、改计划、恢复和重复分开记分,而不是只看任务有没有做完。
提出 AgentTime 基准,评测智能体按时长工作与估时能力
AgentTime 是对智能体时间自控的评测:预测任务耗时、按要求时长工作、事后估计已用时间。
提出 TESTJACK,动态审计编码基准通过判定是否满足任务要求
提出 SPECGUARD,用 Lean 证书在编码 Agent 执行前证明任务冲突
摘要提出预执行冲突检测与证明框架,在多个基准和真实仓库中成功证明任务与测试不可同时满足。
提出 CARE,离线认证 VLA 加速配置的回合级失败风险并选出最快合格候选
CARE 在部署前从加速配置中选出最快、且加速诱发失败风险能被有限样本认证为低于用户预算的候选。证据不足就保留全计算参考策略。
提出 AdvSim2Real,协同训练网页智能体抵御页面注入
提出 ParanoiaEval 评测编码智能体的不必要风险处置
作者提出 ParanoiaEval,并称它是编码智能体风险处置能力的首个统一基准。要解决的问题是:证据已经确定风险应如何处置之后,智能体仍可能扩大验证、增加保护或备份,而现有评测要么只看功能正确性,要么把相关行为拆开研究。做法是把 NIST 的 ATMA 落到仓库任务。
构建基准 DECEPEVAL,评测 LLM 智能体在外部条件下的欺骗
DECEPEVAL 是一个评测 LLM 智能体欺骗如何随任务、职业场景和外部条件变化的基准。
提出 Trust Layer 后置审查框架,核验智能体基准记录分数是否可信
摘要论文提出了后置验证智能体记录分数的四维信任层,揭示了基准高分背后普遍存在作弊、虚报与不稳定现象。
TAPDreamer 用公开编码器做固定补丁。
提出 HERA,协同演化 harness 与环境以提升 Agent 拒答准确性
HERA 在模型权重固定时,让 harness 与可执行环境按失败协同演化,以改进 agentic abstention。
提出 AgentMonBench 评测长时程编程智能体监控并检验 EBG
长时程软件工程任务里,用户要判断智能体哪些选择值得核验。作者用 AgentMonBench 评测监控器,并用免训练的 EBG 组织带源证据。
提出 VERA,审计 LLM 漏洞解释里的虚构推理
提出 SWE-CC 基准,评测编码 Agent 对仓库贡献策略的遵守
SWE-CC 评测编码智能体是否遵守仓库贡献策略,而不只看补丁能否通过测试。
提出 ControlPed 与 HazardPed,生成可控行人危险场景并评测端到端驾驶
提出轨迹级可迁移对抗攻击,降低深度强化学习策略的期望回报
这项工作研究 DRL 上的迁移式黑盒观测攻击:受害参数不可访问时,在白盒代理上造扰动再迁移。