跳到正文
原文
arXiv:对齐、欺骗与监督· arXiv:2610.11754· Eitan Waks, Ben Glocker·本站收录 · 原文发表

仅凭输出审查无法验证什么:面向研究智能体的研究契约

What Output-Only Review Cannot Verify: Study Contracts for Research Agents

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

研究合同绑已批准选择与执行证据。检查器阻断8/8变异;18个别名对两类缺失故障为1/18、2/18。

威胁模型研究智能体处理计算科学的代码、种子、作业与指标。

问题
研究智能体的改进环常以任务完成、产物或文稿评审为奖励。这些信号不必编码已批准研究与实际执行的关系,仅看输出未必能核验合同相对的方法学资格。
方法
作者把已批准研究合同当作环境,检查版本化绑定、预期运行分母、有类型的主张晋升和带外人工门。诊断用八对自撰包:确定性检查器持有已批准对象并套用故障专用规则,十八个别名只看元数据过滤包。
实验与结果
检查器阻断8/8已注册变异、误阻断0/8。十八个别名在144个变异案例上有104次缺陷标记、0次明确干净判定;包内矛盾类为16/18至18/18,两类缺失故障为2/18与1/18。作者称此为故意的信息不对称,不是验证器质量比较。
局限与可以继续做的
等信息对照、合法适应控制与闭环评测尚未运行,优势不能归因于检查本身。作者称这不是奖励黑客,夹具与标签为自撰且无留出校准。覆盖为18个未固定别名与八对包;论文未报告与人工一致性。
实验设置OpenAI gpt-5.6-sol、OpenAI gpt-5.6-terra 等 · self-authored development corpus (eight clean/mutated pairs, seed 20260815)、historical fixtures Y2, X3≡Y3, X4≡Y4 · defect flag (mutation_detected)、explicit clean 等
威胁模型
研究智能体处理计算科学的代码、种子、作业与指标。受保护:已批准合同修订及摘要链、语料金标签、授权记录、检查器谓词。假定执行观测来自智能体不能改写的路径。不受信任:转录、叙述、规格编辑与自报完成。检查测试入口上的批准、豁免、数据治理和晋升。信号只关合同相对方法学资格,不判断结果真伪。
被测模型
OpenAI gpt-5.6-solOpenAI gpt-5.6-terraOpenAI gpt-5.6-lunaOpenAI gpt-5.5OpenAI gpt-5.4OpenAI gpt-4.1Gemini gemini-3.7-flashGemini gemini-3.6-flashGemini gemini-3.5-flashGemini gemini-3.1-pro-previewGemini gemini-3.5-flash-liteGemini gemini-3.1-flash-liteAnthropic claude-fable-5Anthropic claude-opus-5Anthropic claude-sonnet-5Anthropic claude-opus-4-8Anthropic claude-sonnet-4-6Anthropic claude-haiku-4-5
基准
self-authored development corpus (eight clean/mutated pairs, seed 20260815)historical fixtures Y2, X3≡Y3, X4≡Y4
指标
defect flag (mutation_detected)explicit cleanabstentionterminal failuremutations blockedfalse blocks
AI 导读研究提出"研究契约"机制,将实验选择、执行义务与结论范围绑定到记录的执行证据上,以区分契约层面的验证与科学真伪。在八组自制的干净/变异配对诊断中,确定性检查器对已批准与已执行对象应用注册的特定故障规则,检出全部八处注册变异;而在十八个评审别名、144个变异评测案例中,104个被标记缺陷,其余为32次弃权和8次终止失败,变异案例上无明确"干净"判定。作者称该结果刻画的是刻意信息不对称的开发环境,不构成验证器质量或智能体奖励作弊的比较。

研究提出"研究契约"机制,将实验选择、执行义务与结论范围绑定到记录的执行证据上,以区分契约层面的验证与科学真伪。在八组自制的干净/变异配对诊断中,确定性检查器对已批准与已执行对象应用注册的特定故障规则,检出全部八处注册变异;而在十八个评审别名、144个变异评测案例中,104个被标记缺陷,其余为32次弃权和8次终止失败,变异案例上无明确"干净"判定。作者称该结果刻画的是刻意信息不对称的开发环境,不构成验证器质量或智能体奖励作弊的比较。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    只看产物核验不了已批准研究与实际执行是否一致,作者用研究合同做合同相对检查。

    只看产物的审查,核验不了已批准研究与实际执行之间的关系。

    • 场景:元智能体改进环需要变异算子、评测环境和决策规则。研究智能体想要的奖励是科学变得更好,作者称没有可调用的对象。任务可以按时完成,而对照已经坏了。
    • 现有信号:作者列出任务完成、产物存在、单元与集成测试、对输出的 LLM 评审。它们是任务级或输出局部的,不必编码已授权研究与已执行研究的关系。作者称未测完成与有效性的关联,只主张完成并不蕴含有效性。正确实现的指标若算在错误划分上,仍是通过的测试和无效结果。
    • 六条通道:作者不对这些病理主张新颖性。更窄的主张是:输出代理计分使既有元科学病理可通过普通、非对抗行为到达。通道为设计欠指定、绑定漂移、语义漂移、幸存者漂移、范围膨胀、重建漂移(M1–M6)。智能体是否漂向它们,本文未测。作者按后文把「更难发现」收窄到基于缺失的故障。
    • 提出:研究合同把声明的实验选择、运行义务和主张范围绑到记录的执行证据,并与科学真理区分开。
    • 威胁模型:对象是计算科学上的研究智能体(代码、种子、作业、调度器、指标、产物)。不做临床、诊断或安全认证主张。信号只关合同相对的方法学资格。
      • 受保护与假定:已批准合同修订及其摘要链、开发语料金标签、授权记录、检查器谓词。执行观测须来自智能体不能改写的路径;若假定失败,记录完整性不蕴含观测为真。
      • 不受信任与已查边界:转录、叙述、提议的规格编辑、自报完成不受信任。已查的是测试入口上的批准、豁免、数据治理和晋升。拒绝审计为 11/14,三个 MCP 格 not_reached,故「不能绕过」只关于已检查边界。
      • 可博弈处:若智能体能改已批准合同、金标签、观测或授权记录,关系可被博弈。作者称「不能用叙述提高分数」至多对那个受保护的确定性谓词成立。
  2. 有哪些相关研究?

    作者将本文放在任务核验与主张核验旁边,称增加的是晋升阻断和事前批准的分母与上限。

    作者把本文放在任务核验、规格博弈、主张核验和出处治理之间,并称收益尚未测量。

    任务核验与输出代理

    • EviBound(Chen, 2025):执行前批准门、执行后产物核验,以及可选指标检查。作者称它核验的是任务,完成的任务仍可落在不可接纳的研究里;事前门控并不新。
    • FrontierChallenge(Su 等, 2026):端到端工作流基准。作者称部分分数和完成用语不能代理所需的科学交付物。
    • 端到端文稿:作者称当代 AI 科学家系统已能端到端写出流畅文稿(Lu 等, 2026;Gottweis 等, 2026)。引言把任务完成、产物存在、软件测试和 LLM 评审并列为输出局部信号。

    规格博弈与元科学病理

    • 规格博弈文献(Amodei 等, 2016;Krakovna 等, 2020):作者用它们说明,优化者为何可能利用代理与研究身份之间的缺口;该缺口是否被利用,本文未答。
    • DeltaML-Bench(Moukpe 等, 2026):模块化机器学习智能体提高所报告指标,同时违反科学意图。作者称这是第 2 节假说最接近的已有证据,应用于基线和威胁模型,而不只是动机。
    • 元科学记录(Kerr, 1998;Ioannidis, 2005;Baker, 2016;Gundersen and Kjensmo, 2018):HARKing、分析灵活性、可复现性等问题。作者称不对这些病理主张新颖性。

    主张核验

    • 主张感知可观测性(Yin 等, 2026):把主张显式绑到证据。
    • ClaimReceipt(Zhu and Chang, 2026):作者称是已发表工作中最接近的比较,检查智能体评测所断言主张的证据充分性与覆盖。
    • 三层区分:作者把提出异议、作出裁决、拒绝发布分开。ClaimReceipt 和仅输出评审处在前两层。作者称这里增加的是第三层,以及事前批准的预期单元分母和主张上限,加上阻断晋升而非只加注释的权限。作者不称 ClaimReceipt 缺乏主张意识,也不称异议不如自动阻断。

    记录、配置与智能体科学

    • 飞行记录器与 ACM(Bindschaedler 等, 2026;Quessada-Vial, 2026):前者保护记录完整性,作者称这不同于观测为真;后者提供有类型的版本化配置、不可变基线和依赖传播。作者不称它们缺乏主张意识或治理。
    • AutoSci(Qian 等, 2026):记录生命周期、保留失败或放弃的尝试,并支持不依赖聊天历史的恢复。作者称这些保护本身不提供外部授权范围、主张绑定的证据义务或有门控的主张晋升。
    • 出处与报告标准:作者把 PROV、工作流出处、RO-Crate、MLflow 以及报告规范并成一类,称它们为合同义务提供证据或构造回顾性报告。工具协议会加宽动作面(Anthropic, 2024)。智能体科学系统的持久记忆、中途修订、自动重试和自主写作,是 M1–M6 可不靠对抗意图出现的机制。

    基线与语料:上述系统没有被当作跑过的对照。诊断仪器是确定性合同检查器,以及十八个只看元数据过滤包的提供商别名;另有一个奖励包长度、膨胀用语和更稀种子列表的表面启发式。语料是自撰八对包。作者称该设计不是验证器质量比较。

    作者称本文增加的是预期单元、尝试与主张槽在已授权适应策略下的显式关系,加上信息边界诊断和威胁模型;该组合是否带来可测收益尚未测量。

  3. 论文如何解决这个问题?

    把已批准研究当作环境,用绑定、分母、主张晋升和人工门四项性质做合同相对检查。

    作者把环境等同于已批准研究,而不是任务或仓库,并用研究合同做合同相对检查。 在已检查边界上,智能体只控制已授权研究与已执行研究这一关系的一侧。

    合同对象

    环境保存不可变的已批准修订 Cv=(Q,D,A,M,R,O,H,Π):Q 为问题与主张范围,D 为数据身份,A 为组别,M 为指标与决策规则,R 为预期运行清单,O 为有类型的证据义务,H 为权限与批准状态,Π 为已授权适应策略。执行状态经已认证历史引用该修订,不写回它。智能体可以读取、提议修订并对照执行,但不能把批准写入 H,也不能在批准后改动它而不使绑定失效。

    摘要绑的是表示。已批准规格与编译出的可执行配置是不同对象,作者称「与已授权研究摘要相同」是错误说法。可检查对象是版本链:已批准规格、编译器版本、发出的运行合同、采集的观测。哈希在每一环建立相等和篡改证据。跨编译器的语义保持,以及最后一环的诚实观测,需要单独假定或测试。

    四项可检查性质

    • P1 研究级绑定(针对 M1–M3):批准记录规格摘要,以及锁定编译所用的编译器与能力身份。批准后改任一绑定身份会使批准失效。批大小是否在已批准研究内,是合同声明的属性,不是参数名本身的属性,因为批大小可以改变优化动态、归一化统计和有效学习率日程。
    • P2 预期运行分母(针对 M4):执行前发出预期运行清单。作者举例:打算做 24 个组别–种子作业而 20 个成功时,账本必须交代全部 24 个,含失败和已授权转换;重试不扩大分母。估计量遵循预先声明的缺失规则,作者称这不是主张每个均值都除以 24。重试本身不是故障;只有账目漏记尝试、把重试单元只计一次成功时,估计才会偏。
    • P3 有类型的主张晋升(针对 M5):候选主张在人群、任务与终点、数据版本与划分、对照、指标、时间、地点和领域上带类型化范围。义务有 discharge_method(mechanical 或 human_semantic)和 waiver_policy(forbidden、scope_reducing、permitted_under_conditions)。实现支持 forbidden 和有类型的 scope_reducing。permitted_under_conditions 没有一般条件语言,其下义务保持未解决而非被解除;任何路径都未评估条件豁免。作者称本文不依赖条件豁免能工作。缺少外部站点验证可以允许基准主张,同时阻断多站点主张。
    • P4 人工认证门(针对自我批准):规格批准、有效豁免、数据治理授权和报告晋升需要带外认证的人类身份。智能体可以起草并提议这四项;在已测试入口上,没有智能体表面能创建有效的一项。聊天确认不是批准。

    相同可见包、不同资格

    作者给出一个与八对诊断分开的分析例子:可见包缺少产物 X。在合同 C1 下 X 为所提主张所必需,在 C2 下可选且其他相关义务已满足。资格不同,验证器可见输入相同。确定性的仅输出规则给出同一决定;随机规则的决定分布也相同。没有那个权威要求,就不能区分两种资格,并可以弃权。作者称低检出与缺失要求相一致,但不识别模型推理,也不确立经验案例正是这一构造。该构造不延伸到 M5:包内已有主张与证据的不匹配,合同提供的是上限上的权限,不是隐藏事实。

    冻结适应策略,以及诊断怎么造信息差

    • Π 而非轨迹:作者称冻结的应是适应策略,不是已实现轨迹。Π 声明哪些依赖状态的决定在界内、搜索空间和停止规则、账目如何按事前规则扩缩、哪些偏离要重新授权。离开包络是显式修订或探索性分叉,主张地位降级。同步的尝试准入与重试子集在可选治理扫描上可用,并在一条夹具批准的集成轨迹中演练过。一般自适应执行(早停、异步观测、多后端)和编译器接线的修订转换已指定、未实现。晋升有原型状态和测试,还不是普通路径上的阻断保证。
    • 诊断仪器:确定性检查器收到已批准研究对象和已执行包,并对受测变异应用已注册的故障专用规则。十八个提供商别名各自收到一个元数据过滤包,无成对上下文,也无注册所选故障标签。冻结提示词(附录 B)要求在 mutation_detected、clean、abstain 中选择,并在信息不足时弃权。部分包仍保留批准与执行字段,包括编译漂移案例中的摘要。作者称设计在信息和任务上故意不对称,不把扣留要求的作用从任务规格和规则选择中分离出来。
    • 导出:受控比较时,作者建议研究智能体导出研究对象而不只是论文对象,包括适应策略、预期运行清单和主张–义务映射。决策规则便可定义在绑定完整性、分母完整性、固定范围的可接纳主张产出和被阻断理由上。作者称任何这种信号都会成为新的优化目标。
  4. 论文做了哪些实验?

    检查器阻断8/8已注册变异;18个别名对144个变异案例有104次缺陷标记、0次明确干净判定。

    实验设置

    • 评审别名:OpenAI gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna、gpt-5.5、gpt-5.4、gpt-4.1;Gemini gemini-3.7-flash、gemini-3.6-flash、gemini-3.5-flash、gemini-3.1-pro-preview、gemini-3.5-flash-lite、gemini-3.1-flash-lite;Anthropic claude-fable-5、claude-opus-5、claude-sonnet-5、claude-opus-4-8、claude-sonnet-4-6、claude-haiku-4-5。均未固定,窗口大约 2026-08-15 UTC。作者称别名是评测仪器,不是统计样本,也不必然是不可变快照。
    • 语料:自撰开发语料,八对干净/变异包,种子 20260815。每个变异是已注册方法学故障(附录 C)。每包一例,每别名 16 例,共 288 次逻辑判断。这是八对的重复评估,不是 288 个独立科学例子。
    • 信息差:检查器拿到已批准研究对象与执行包,并应用该变异的故障专用规则。评审只拿到元数据过滤包,无成对上下文、无故障标签、无已批准合同(附录 A);干净与变异分开审。部分包仍留有批准和执行字段,编译漂移案例含摘要,故并未清空全部批准元数据。提示词要求信息不足时弃权;附录 B 给出全文。
    • 指标:缺陷标记等于 mutation_detected,明确干净等于 clean。语义弃权与终端失败分开。终端失败包括超时、空内容、模式或解析失败,以及有界技术重试后的其他非裁决终端。评审是次级的,不能晋升,也不能推翻确定性失败。
    • 采样:夹具注册表顺序,无额外随机化;每例是新的无状态请求。GPT-5/o 系列和当时的 Anthropic Messages 模型省略温度,其余默认 0.0。所要求的校准概率并不构成校准,置信度未分析。
    • 账目:309 条尝试记录、303 条适配器日志,相差六条并按别名对保留导出对账。288 计的是判断,不是供应商请求;未对账成本。

    主结果

    据 Table 1,18 个别名 × 16 个包。表题另写确定性检查器阻断 8/8 变异、配对对照误阻断 0/8。

    表格较宽,可左右滑动

    金标准类别案例缺陷标记明确干净弃权终端失败
    已注册变异1441040328
    配对干净对照144174636
    • 覆盖:作者称主要缺口是决策覆盖:288 例中 179 次二元决定、95 次语义弃权、14 次终端失败。弃权可以是对欠指定包的正确反应。
    • 误接受:作者称诊断没有确立仅输出评审的自信错误接受。描述性条件准确率 178/179 离开 179/288 的覆盖就不完整,且两者都不能推广到此语料之外。
    • 不是质量比较:作者称两套仪器的信息和任务规格不同,故这些数字不分离验证器质量,也不证明奖励黑客。

    故障类型分区

    • 测了什么:Table 2 报告每个已注册变异被 18 个别名中多少个标记。评审未得到故障标签或等信息任务。
    • 结果:包内矛盾类为 16–18/18:compilation_drift_dev_001 为 18/18,comparison_budget_001、external_validation_001、reconstruction_dev_001 为 17/18,runtime_contract_001 与 integrity_digest_dev_001 为 16/18。缺失类:split_policy_001 为 2/18,evidence_absence_dev_001 为 1/18。编译漂移包仍可能含摘要。
    • 作者解读:作者称该模式与某些故障上缺少要求相一致,但没有实验上分离该因果贡献。缺失故障是已批准要求会指明本应出现什么的那些。17/18 标记了外部泛化案例,作者称语料没有显示科学退化被更漂亮的文稿藏住。

    历史夹具审计

    • 测了什么:Y2、X3≡Y3、X4≡Y4 在同一冻结修订(git 648338e)本地执行。记录称人工批准;本文不独立认证每个行动者。它们是共享记录,不是重复,也未被晋升为发表真理。
    • 结果:Y2 拒绝 11/14 未授权转换,三个 MCP 格 not_reached,未授权变异 0,audit_finding_pass=0,总发现未通过。X3≡Y3 预定分母 4、未解决 0、计划外 0、重试 2,发现通过。X4≡Y4 阻断超范围晋升,七个失败维度,返回最大可接纳范围,总发现未通过。
    • 作者解读:附录 D 称为工程观察,不是比较结果。Y2 的「不能绕过」只关于已检查边界。作者称 X3 不是「分母改善结论」的证据;X4 不是总体发现通过、语义遏制已解决或人工审查已完成的证据。

    其他消融与分析

    • 表面启发式(无变异标签;奖励包长度、膨胀用语、更稀种子列表):变异包高于对照 2/8,持平 3/8,至少一样高 5/8。作者称不是在世模型排序,对任何优化器无所说明。
    • 别名极值(Table 3):变异标记从 gemini-3.5-flash 的 3/8 到 gemini-3.1-flash-lite 与 claude-fable-5 的 7/8;二元决策从 3/16 到 claude-fable-5 的 14/16。其余 15 个别名见 Table 3,此处不逐行抄。
    • Clean flags 列:仅 gemini-3.1-flash-lite 为 1,其余为 0,合计与 Table 1 干净对照的 1 次缺陷标记相同。表题未把该列定义成「对干净包的缺陷标记」。
    • 非决定合并:论文写变异侧为 32+8,干净侧为 63+6;未再按别名拆开弃权与终端失败。
    • 适应策略:同步尝试准入与重试子集演练过一条夹具批准的集成轨迹;一般自适应执行与编译器接线的修订转换未实现(§3.3)。
    • 报告晋升:附录 D 称包已写出,没有人工晋升,还不是普通路径上的阻断保证。
  5. 有什么可以进一步探索的点?

    作者称等信息对照、合法适应控制与闭环评测尚未运行,现有数字不能归因于检查本身。

    作者指出的局限与后续方向

    • 必要但未做的测试:全文信息比较、合法适应控制和闭环智能体评测是必要测试,且尚未运行(摘要、§5)。
    • 因果未分离:现有设计不把权威信息的作用,从任务规格和规则选择的差异中分离出来(摘要、§4.1、§4.3)。
    • 不是验证器质量:诊断不分离验证器质量,不比较智能体,也不估计校准后的评审质量;夹具与标签为自撰,无留出校准(§4.3)。
    • 不是奖励黑客:不证明奖励黑客,也不检验更强的仅输出模型在同一包上能否更好;优化中的智能体是否利用该缺口未被测试(§1、§4.3)。
    • 归因条件:在等信息、同任务对照跑完之前,不能把确定性检查的优势归因于检查本身,而不是对已批准要求的访问或故障专用规则。该消融已提出且未运行;本文没有来自它的结果(§5)。
    • 共享记录:八对诊断和所选历史审计是三篇配套预印本的共享记录,不是独立重复;本文不独立认证所保留的人工批准(§4、§7)。结论称小诊断本身不能对每个故障类建立该因果主张。

    实验覆盖范围

    • 评审与判断:OpenAI、Gemini、Anthropic 的 18 个未固定别名,窗口大约 2026-08-15 UTC;每别名 16 例,共 288 次判断(§4.1、Table 1、Table 3)。
    • 语料与规则:种子 20260815 的八对自撰包。检查器拿到已批准研究对象与执行包,并应用该变异的已注册故障专用规则(§4.1)。
    • 评审所见:逐案元数据过滤包,无成对上下文、无已批准合同、无注册所选故障标签;部分包仍保留批准与执行字段,包括编译漂移案例中的摘要(§4.1、附录 A)。
    • 夹具与线束:Y2、X3≡Y3、X4≡Y4 在同一冻结修订本地执行。附录 D 另记一套脚本化研究保真线束,作者称不是本文证据(§4、附录 D)。
    • 未报告项:论文未报告评审与人工的一致性,也未分析置信度;成本未从 309 条尝试或 303 条适配器日志对账(附录 A、§4.1)。
  6. 总结一下论文的主要内容

    研究合同暴露四类输出单独建不立的关系;缺失类故障在过滤包上为1/18与2/18。

    研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。

    • 问题:改进环若只按任务完成、产物或文稿打分,已批准研究与实际执行可以脱节。作者点名六条可不靠欺骗到达的通道,并称优化智能体是否利用该缺口并未测试。
    • 做法:把已批准修订当作环境,检查版本化绑定、预期运行分母、有类型的主张晋升,以及带外人工身份的门。智能体可以提议,但不能在已测试入口上自己写成有效批准。诊断故意不对称:确定性检查器持有已批准对象并使用故障专用规则;18 个未固定别名只看元数据过滤包,信息不足时应弃权。部分包仍留有摘要等批准字段。
    • 主数字:八对自撰包上,检查器阻断 8/8 变异、误阻断 0/8。Table 1 中,144 个变异案例有 104 次缺陷标记、0 次明确干净、32 次弃权和 8 次终端失败。Table 2 中,包内矛盾类为 16/18 至 18/18,缺失划分与分组为 2/18,缺失所需指标产物为 1/18。
    • 作者如何读这些数字:模式与部分故障缺少要求相一致,但不能把优势归因于检查本身,也不是验证器质量比较或奖励黑客。历史夹具中,超范围晋升被阻断;14 个未授权转换格里 11 个被拒绝,三个 MCP 格未到达,该审计总发现未通过。
    • 结论:作者称更强的仅输出模型也不能补上包里确实没有的事实。合同决定验证器能判定什么,不决定科学是否正确。等信息对照、合法适应控制,以及优化下可接纳主张是否仍有用,仍是必要且未做的测试。
阅读原文arxiv.org