跳到正文
原文
arXiv· arXiv:2610.00327· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Yina Sa, Daren Zha, Jun Xiao·本站收录 · 原文发表

Actions with Receipts:为工具智能体审计绑定声明、证据与执行

Actions with Receipts: Jointly Binding Claims, Evidence, and Execution for Replayable Tool-Agent Auditing

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

EC-Agent 用声明锚定的联合回执把主张、证据与执行绑定,在 1,280 次跨对象替换中检出 1,275 次。

威胁模型受信任的 runner 与 observation logger 在执行中记录轨迹;摘要在答案事件之后提交。

问题
工具智能体可以同时给出引用和执行日志,但用户看到的主张是否就是已提交执行发出、并由所引来源支持的那一条,仍可能没有被审计。合法引用和合法轨迹可以各自格式正确,却被移植到别的主张、动作、运行或来源版本上。
方法
EC-Agent 用声明锚定的执行契约,把发出的主张、精确来源片段、产生它的有序执行前缀,以及该次执行观察到的来源版本和访问状态联合绑定。确定性完整性验证器在接入语义或任务标签之前重建这些绑定,并与可插拔的支持平面分开。
实验与结果
在 1,280 次跨对象攻击中,联合契约检出 1,275 次(0.9961);去掉一项针对性属性后,对应攻击检出率降到 0.0156–0.0625。独立裁决的 384 对上,冲突感知守卫的 F1 为 0.8865、false acceptance 为 0.0729;未见失败族上分别为 0.8679 和 0.0938。
局限与可以继续做的
完整性保证假设 runner 与 observation logger 受信任;固定语料筛查使用由标题派生的主张,语义结果依赖裁决量表和冻结的支持评估器。未见族测试覆盖所声明的语言扰动;开放语义偏移和被攻破的记录器需要更多证据。
实验设置HotpotQA dev-distractor(128 条固定语料)、64-row train-corpus 等 · detection rate、false-rejection rate 等
威胁模型
受信任的 runner 与 observation logger 在执行中记录轨迹;摘要在答案事件之后提交。变异审计中的攻击者可在运行后修改已持久化的回执字段、源文本、事件顺序或选定事件属性。完整性平面与可插拔的支持平面分离。
基准
HotpotQA dev-distractor(128 条固定语料)64-row train-corpus20-case non-title calibration384 claim–span pairsunseen failure familiesmatched model-backed agent tasksdynamic documents
指标
detection ratefalse-rejection rateF1false acceptancetask successjoint replaycoveragestale rejectioninjection resistance
AI 导读全文 359 字

论文提出一种以声明为锚点的执行契约,把智能体输出的声明、其精确来源片段、产生该声明的有序执行前缀,以及执行时观察到的来源版本与访问状态联合绑定,用于可回放的智能体审计。每条回执包含一个发射锚点,可在已提交答案或带声明的动作中确定性地定位该声明,并附带来源标识、偏移、哈希、引文和域分隔的执行承诺。确定性完整性验证器在接入语义或任务标签之前先重建这些绑定,作者将完整性平面与可插拔的支持平面分离,避免用结构有效性代替蕴含判断。契约给出七个可独立测试的属性,包括声明与发射绑定、来源绑定、有序执行绑定、oracle 分离、持久对象回放、执行重跑一致性和版本与访问绑定。在 1280 个跨对象攻击中,联合契约检出 1275 个替换,检出率 0.9961;移除任一目标属性后,其攻击检出率降至 0.0156 至 0.0625。

深度解读

6 个问题,约 9,500 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    工具智能体的引用和轨迹可各自合法,却被跨主张、动作、运行或来源版本移植。

    工具智能体展示的主张、所引来源片段和产生该主张的执行,缺少可重放的联合绑定。

    • 场景:作者称,工具智能体常返回答案并附引用,下游审计者需要每个中间主张对应的文档版本、片段和执行事件。任务基准侧重效用与完成,引用评估器在生成后度量支持或归属,来源记录本身还不是可持久化、可重放的确定性对象。
    • 缺口:主张级记录可以指出来源片段,却不能确立被引主张由正在审计的执行发出;有序执行日志可以重建工具调用和观察,却不能确立某条证据支持答案中的哪一段子串。两者分开存储会在答案、动作、运行和来源版本之间留下移植歧义。
    • 假设:最小可审计单元是元组(发出的主张、来源片段、来源版本、有序执行前缀)。结构性有效不应被当作蕴含的代理,因此完整性平面与支持平面分开。
    • 提出:作者提出 EC-Agent 的声明锚定联合回执,把保证拆成七个可独立测试的性质,并用跨对象变异测试替换抵抗、性质必要性、系统级基线、审计不干扰、语义支持、模型支持的工具使用,以及冻结身份下的动态来源状态。
    • 威胁模型:
      • 信任边界:受信任组件是 runner、observation logger、本地语料清单、验证器实现和重放环境。runner 与 observation logger 在执行期间受信任,摘要在答案事件之后提交所记录的轨迹;在线策略收不到单独的 oracle 标签。
      • 攻击者能力:变异审计中的攻击者可在运行结束后修改已持久化的回执字段、源文本、事件顺序或选定事件属性。结构性改动应在相应的引用、哈希、引文、模式或摘要检查处失败。
      • 不保证的部分:观察真实性是外部性质,需由签名的仅追加日志、已认证事件源或硬件背书的证明等锚点,加上文档版本与访问控制身份来提供。作者将已认证观察锚点视为需要它们的部署的扩展点。
      • 受害对象与判定:审计对象是已提交的联合回执。完整性验证器在接入语义或任务标签之前重建绑定;词法对抗变异保留足够 token 重叠以通过已实现谓词并被接受,作者用此说明密码学完整性与语义充分性相互独立。
  2. 有哪些相关研究?

    相关工作分工具智能体基准、归属评估和来源完整性原语;作者把贡献放在可执行的联合关联上。

    作者把相关工作分成工具使用与过程验证、检索归属,以及数据来源与供应链完整性三类,并单独区分主张来源与执行来源。

    工具智能体与过程验证

    • 动作环境:Schick 等(2023)、Li 等(2023)、Qin 等(2024)、Zhou 等(2024)、Liu 等(2024)、Xie 等(2024)、Lu 等(2024)、Yao 等(2024)、Debenedetti 等(2024)定义从 API 调用、浏览器任务到有状态用户交互和提示注入评测的环境。Deng 等(2023)、Drouin 等(2024)给出网页轨迹和动作接口。作者称这些基准主要给任务完成、交互质量或攻击抵抗打分。
    • 忠实性与中间步骤:Turpin 等(2023)显示生成的理由可以偏离产生它们的动作。ReAct、Reflexion、Self-Refine 推动动作级推理与反馈(Yao 等,2023;Shinn 等,2023;Madaan 等,2023);Lightman 等(2024)、Wang 等(2023)、Zheng 等(2024)评估中间推理决策。
    • 与本文的关系:作者称 EC-Agent 补上这些路线,使一次运行的证据引用和事件顺序可以独立检查。

    检索增强与归属

    • 引用与原子事实:ALCE 同时评估答案质量与引用质量(Gao 等,2023);FActScore 把长文生成分解为原子事实(Min 等,2023);Yan 等(2025)、Wei 等(2026,GenProve)研究证据选择和主张级支持。
    • 幻觉与检索质量:RAGTruth、ARES、RAGAS 把评测扩展到幻觉和检索接地质量(Niu 等,2024;Saad-Falcon 等,2024;Es 等,2024)。作者称这些工作提供任务级或语义评估信号。
    • 与证书验证器的区别:作者称证书验证器检查确定性回执契约;两者互补,因为语法上有效的回执仍可能附上语义上不充分的片段。Table 1 把 ALCE / FActScore / GenProve 的绑定目标写成 claim-source attribution,完整性单元写成 semantic / atomic claim,主要关注 grounded generation。

    来源与供应链完整性

    • 原语:数据库 where-provenance(Buneman 等,2001;Cheney 等,2009)、W3C PROV(2013)、Merkle 树(Merkle,1988)、Certificate Transparency(Laurie 等,2021)、in-toto(Torres-Arias 等,2019)和 C2PA(2024)分别承诺有序内容、仅追加日志证明,或把供应链步骤绑到已签名布局。Table 1 把这一族的绑定目标写成 entities / workflow / media,主要关注 content history。
    • 主张来源与执行来源:作者称,细粒度来源方法把生成语句接到支持证据,包括生成时对引用、压缩和推断的区分;执行来源工作记录动作、观察、工具交互和状态转移。作者认为二者互补,但都没有规定精确发出的主张与产生它的执行前缀之间的密码学关联。
    • 基线方法与基准:固定语料上比较 no certificate、final-only、action-level、evidence-aware;模型支持实验再加入 conflict-aware guard。数据侧使用本地 HotpotQA dev-distractor 的 128 条记录、单独的 64 条 train 语料、20 例非标题校准,以及附录 D 的独立裁决、模型支持工具使用和动态文档协议。Table 1 把智能体基准的主要关注写成 tool-use utility。

    作者把本文定位为:在主张、证据、执行和来源状态之间建立可执行关联,并配上重放与替换测试;Table 1 描述各路线已记载的侧重点,附录 C.1 则把必须作为联合契约评估、而不能只从引用或日志元数据推断的能力写成显式性质分解。

  3. 论文如何解决这个问题?

    回执把主张锚点、来源片段、执行摘要和版本状态做成提交后可重放的联合承诺。

    EC-Agent 为每条发出的主张构造联合回执,由确定性完整性验证器在冻结轨迹之后重建绑定;语义支持由单独的评估器给出,不进入在线策略。

    问题设定与回执对象

    • 执行实例:一次执行是 x = (q, D, ≺, B),q 为请求,D 为可用来源状态,≺ 为声明的观察顺序,B 为执行预算。策略产生有序事件 E 和答案 a。仅供评估器使用的标签 y 留在在线状态之外,只在持久化、包重放和执行重跑之后接合。
    • 联合元组:对每条主张 c,U(c) = (ρc, Rc, Dexec, m, ν)。ρc 是发射锚点,Rc 是有序证据引用集,Dexec 是执行承诺,m 是运行/语料清单身份,ν 是来源版本与访问状态身份。回执只在每个分量都能从已提交对象重建、且跨对象关联一致时被接受。
    • 七个性质:P1 主张发射绑定、P2 来源绑定、P3 有序执行绑定、P4 oracle 分离、P5 持久化对象重放、P6 执行重跑一致性、P7 版本/访问状态绑定。附录 C.1 把每项映射到字段、检查和证据边界。

    发射绑定与联合承诺

    • 锚点:ρc = (j, f, u, v, hc),hc = SHA256(UTF8(c))。j 是从零起的事件下标,f 是模式声明的文本字段,[u, v) 是该字段上的半开 Python 字符串区间。验证器重建子串并要求它等于 c 且哈希相符;越界锚点、未声明字段、哈希不符和与已提交子串不同的主张均失败关闭。多个最终答案主张先确定性抽取为主张 ID 和锚点,抽取配置属于 m。
    • 联合摘要:令 HR = SHA256(UTF8(J(Rc))),Hm 承诺契约要求的清单字段。Djoint(c) 对域分隔串、Dexec、hc、锚点、HR 和 Hm 做 SHA-256。持久化回执含 (c, ρc, Rc, Dexec, Djoint)。作者称,把回执移植到别的主张、动作、执行、清单或来源版本会改变验证器输入。
    • 执行摘要:Dpre = SHA256(UTF8(δtrace) ∥ UTF8(J(E)))。δtrace 是补充材料中逐字节规定的域分隔符,J(E) 是键序固定的规范 JSON。摘要在答案事件之后、回执发出之前计算;回执字段、验证器结果和外层包摘要不进入被承诺的前缀。

    完整性平面与支持平面

    • 完整性:Vint = Vemit ∧ Vsource ∧ Vtrace ∧ Vjoint ∧ Vstate,分别核验主张锚点、来源内容、有序执行、联合承诺和来源状态。Vint = 1 不蕴含支持为真。
    • 词法支持:可选评估器在两侧 token 集非空时接受大小写折叠、空白折叠后的子串,或 token 交占比至少 0.5;token 由 Python 的 Unicode 词字符正则在 casefold 后得到,长度至多为 1 的 token 被去掉。该规则不做 Unicode 规范化、词干或标点剥离,作者称它弱于语义蕴含,且不改变 Vint。策略侧早停调用同一谓词。
    • 覆盖:对非空必需主张集 R,覆盖率是 R 中至少有一个被引用的不可变片段通过所选支持谓词的主张比例。作者称每个被报告的行有一条必需主张,因此分母为 1;该指标与 supporting-fact recall 分开。证书是否存在也与覆盖分开报告。

    生命周期与信息边界

    • 顺序:加载冻结语料与预算账本;记录允许的观察和答案事件;规范化并承诺事件前缀;发出锚点与联合回执,完整性与支持分开计算;把 oracle-free 的包写入外层摘要;不执行策略地重载并复查;再做一次确定性执行重跑并比较轨迹摘要;最后才接合 oracle 标签。
    • 在线可见信息:在线策略只收到对应公开证据摘要中列出的字段。Oracle 标签、目标答案、隐藏卡片和未来服务输出分开存放,只在轨迹决策冻结后接合。
    • 记录器边界:runner 和 observation logger 定义策略可见的记录视图。评测在此边界内度量来源绑定、事件顺序完整性和执行重跑一致性。

    策略变体

    • 四种主变体:no certificate 记录任务事件但不发回执;final-only 为最终必需主张发一条回执;action-level 在配置的承载主张的动作点发回执;evidence-aware 用第一个通过共享词法谓词的检索片段作为停止与支持信号。
    • 匹配控制:四种模式使用同一次首先支持的检索和一次工具调用,用来把回执开销与停止策略分开。模型支持实验在同一隐藏任务 ID 上再加入 conflict-aware guard。
  4. 论文做了哪些实验?

    联合契约在 1,280 次替换中检出 1,275 次;语义支持与任务效用分开报告。

    实验设置

    • 固定语料:主筛查为 128 条本地 HotpotQA dev-distractor 记录,另有 64 条 train 语料,两者不合并。每条用排名最高的公开文档标题同时作为候选答案和必需主张。在线策略看不到 oracle 答案或 supporting-fact 标识。另有受信任的 runner/logger 和 locked-test 守卫。
    • 策略与基线:固定语料比较 no certificate、final-only、action-level、evidence-aware。模型支持实验为这四者加上 conflict-aware guard,共五种,按任务 ID 和种子配对。
    • 指标:完整性含证书/证据有效性、包重放和执行重跑;必需主张的词法覆盖;匹配成本为调用次数、声明 token 和验证器调用。语义精度、召回、F1 按 TP/FP/FN 定义;false acceptance 为 FP/(FP+TN),针对语义上不支持的主张。标题代理是仅 oracle 的候选标题精确比较。
    • 语义标注:两条主张来自与 dev、train 和 20 例校准不相交的来源行。两名标注者把每对标为 supported、contradicted、incomplete 或 unsupported;主二分类把 supported 映为 1,其余为 0。第三人裁决分歧,且看不到策略身份或模型条件。标注者看不到文档身份、策略名、模型条件、词法分数、候选答案和 oracle 结果。
    • 模型支持协议:冻结模型端点或本地检查点、系统提示词、工具模式、temperature、上下文限制、重试策略和每任务调用/token 预算。论文未在正文给出具体模型名称。三个种子做配对比较,报告跨种子均值;任务级区间用按任务 ID 的配对 bootstrap。
    • 变异与动态:从 16 份有效 final-only 证书出发,每份施加十种变异。动态实验在冻结的版本与访问状态下比较过期拒绝、未授权片段拒绝、注入抵抗、冲突消解和受扰动任务成功。

    主结果

    跨对象替换与去掉单性质后的针对性检出率如下。作者称联合契约检出 1,275/1,280(0.9961),报告的 false-rejection rate 为 0.0031;证据与来源版本移植的检出为 1.0000,跨运行交换为 0.9922。

    表格较宽,可左右滑动

    设置ClaimSourceEventOracleBundleRerunVersion
    Full contract0.99221.00001.00001.00000.99220.98441.0000
    Remove P10.03121.00001.00001.00000.99220.98441.0000
    Remove P20.99220.03911.00001.00000.99220.98441.0000
    Remove P30.99221.00000.02341.00000.99220.98441.0000
    Remove P40.99221.00001.00000.01560.99220.98441.0000
    Remove P50.99221.00001.00001.00000.04690.98441.0000
    Remove P60.99221.00001.00001.00000.99220.06251.0000
    Remove P70.99221.00001.00001.00000.99220.98440.0234

    据 Figure 2,精确比率在 Table 17。去掉一项后,其针对性攻击的检出降到 0.0156–0.0625,作者称无关检查保持不变。

    • 弱绑定对照:作者称,引用加上独立轨迹在主张移植上达到 0.1797,再加共享 run ID 达到 0.2266;显式主张锚定与联合承诺达到 0.9922。Table 18 报告全部匹配基线比较。
    • 固定语料协议:Table 2 中 final-only、action-level、evidence-aware 的证书有效、证据有效、包重放、执行重跑和覆盖均为 1.0000,标题代理均为 0.0781;no certificate 的回执字段为 N/A,代理同为 0.0781。作者称,因为候选答案复制自所选标题,该筛查测的是契约执行而不是语义泛化。64 条 train 语料的同一代理为 0.0625。
    • 不干扰与时延:作者称仅审计的插桩保持精确事件轨迹的比率为 0.9986、最终答案为 0.9992,任务成功差为 0.0000。序列化、在线完整性验证和包重放分别为每次执行 0.19、0.47、1.31 ms;单独的执行重跑为 16.88 s。Tables 27 和 28 给出完整测量。

    结构性变异与词法边界

    • 测了什么:九类结构变异为哈希、偏移、引文、文档版本、片段、事件重排、检索失败、缺失证据和 oracle 字段注入,共 144 次;另有词法对抗控制 16 次。
    • 结果:Figure 3 与正文写明,结构篡改 144/144 被拒绝,词法对抗主张 16/16 被接受。Table 9 将 160 次变异记为同一边界。
    • 作者的解读:作者称回执使来源损坏可观察,而词法支持规则仍弱于语义蕴含;这组结果被当作完整性边界,不当作语义泛化。

    语义支持

    • 20 例校准:Table 4 在相同主张–片段对上,词法规则 TP/FP/TN/FN = 8/8/3/1,精度 0.5000,召回 0.8889,false acceptance 0.7273,false rejection 0.1111。带守卫的比较为 8/0/11/1,精度 1.0000,召回 0.8889。分母为这 20 对。
    • 384 对:冲突感知守卫精度 0.9213、F1 0.8865,词法重叠为 0.7328 和 0.8019;false acceptance 为 0.0729 对 0.3229。标注者 κ = 0.834,区间 [0.789, 0.879]。Figure 4 的柱为合计比率,须状线为 95% 区间;论文未在正文列出 Valid. 各柱的精确读数。
    • 未见失败族:Table 7 中冲突感知守卫精度 0.8994、召回 0.8385、F1 0.8679、false acceptance 0.0938、覆盖 0.4479。词法重叠召回 0.8594、覆盖 0.5781、false acceptance 0.3490。冻结 NLI 的 F1 为 0.8468,冻结 LLM judge 的 F1 为 0.8661、召回与词法重叠同为 0.8594。作者称守卫的必需主张覆盖低于词法重叠,构成覆盖权衡。

    模型支持的工具使用与动态来源

    • 五种策略:Table 6 为三个配对种子的合计点估计。conflict-aware guard 的任务成功 0.7278、语义 F1 0.8721、false acceptance 0.0617、联合重放 0.9976、每次任务 5.46 次调用和 16.31 秒。evidence-aware 的任务成功最高,为 0.7312,时延最低,为 15.68 秒,调用 5.34 次。no certificate 成功 0.7139、语义 F1 0.6817、false acceptance 0.2876、调用 7.86、时延 19.42 秒,联合重放为 N/A。final-only 与 action-level 的成功为 0.7114 和 0.7205,联合重放为 0.9987 和 0.9979。作者称联合重放只在包重放和执行重跑都通过时成功。正文另给匹配的三种子守卫合计:任务成功 0.7278、语义 F1 0.8721、false acceptance 0.0617、联合重放 0.9976,与 Table 6 的守卫行一致。
    • 动态来源:过期拒绝 0.9947,未授权片段拒绝 0.9896,注入抵抗 0.9078,冲突消解 0.8892,受扰动任务成功 0.8127。作者称版本绑定抓住过期片段,同时保留已授权的任务完成;分母和不确定性写在配套表中,正文未列出这些分母。
    • 成本:Table 3 的匹配一次检索中,四种策略调用都是 1.00,代理都是 0.0781;no certificate 为 6.0 个声明 token、0 次验证器调用,其余三者为 9.0 个 token 和 1 次验证器调用。作者称相对 no certificate,发出回执在该夹具上增加 3.0 个声明 token 和一次验证器调用。更早的 9.94 次调用路线被当作单独的停止策略诊断。

    其他消融与分析

    • Figure 2 对角:去掉 P1 后主张交换检出 0.0312;去掉 P2 后来源交换 0.0391;去掉 P3 后事件重排 0.0234;去掉 P4 后 oracle 泄漏 0.0156;去掉 P5 后包漂移 0.0469;去掉 P6 后重跑漂移 0.0625;去掉 P7 后版本交换 0.0234。
    • 审计插桩:事件轨迹保持率 0.9986,最终答案保持率 0.9992,任务成功差 0.0000。
    • 每次执行时延:序列化 0.19 ms,在线验证 0.47 ms,包重放 1.31 ms,执行重跑 16.88 s(Tables 27、28)。
    • 固定语料四种发证策略的协议字段均为 1.0000,标题代理均为 0.0781(Table 2);64 条 train 代理为 0.0625(Table 9)。
    • 20 例上,守卫把 FP 从 8 降到 0、TN 从 3 升到 11,FN 仍为 1(Table 4)。
    • 未见族上守卫覆盖 0.4479,低于词法重叠的 0.5781,同时 false acceptance 从 0.3490 降到 0.0938(Table 7)。
  5. 有什么可以进一步探索的点?

    作者把受信任记录器、标题派生主张和开放语义偏移列为还需要证据的部分。

    作者指出的局限与后续方向

    • 受信任记录器:完整性保证假设 runner 和 observation logger 受信任(第 4.10 节 Limitations)。被攻破的记录器需要更多证据(同节)。
    • 标题派生主张:固定语料筛查使用由标题派生的主张(第 4.10 节)。
    • 语义依赖:语义结果依赖裁决量表和冻结的支持评估器(第 4.10 节)。
    • 扰动范围:未见族测试评估的是所声明的语言扰动;开放式语义偏移需要更多证据(第 4.10 节)。
    • 时延条件:模型支持的时延依赖于所记录的服务与并发条件(第 4.10 节)。
    • 复现范围:补充材料把实现级重放、所报告的合计,以及全量运行重建所需的输入分开;复现某项合计需要对应的行级证据和冻结的语料或任务清单(Reproducibility Statement,并指向 Table 30)。观察真实性被写成外部性质,已认证观察锚点是单独的扩展点(第 3 节与附录 A.5)。

    实验覆盖范围

    • 固定语料主筛查为 128 条 HotpotQA dev-distractor 记录,另有分开报告的 64 条 train 记录;协议有效性在标题复制构造上测量(第 4.1–4.3 节,Table 2,Table 9)。
    • 跨对象检测以 1,280 次攻击为分母;去掉单性质的检出率按 Figure 2 的七列变异报告,完整对比在 Table 17 和 Table 18。
    • 结构变异为 16 份证书乘以九类结构改动共 144 次拒绝,另加 16 次词法对抗接受;20 例校准与 384 对独立裁决、以及 Table 7 的未见失败族分开报告(第 4.5–4.7 节)。
    • 模型支持实验比较五种回执策略,数值为三个配对种子的合计点估计;论文未在正文写出该冻结端点或检查点的模型名称(第 4.7 节,Table 6,附录 B.6)。
    • 动态文档报告过期拒绝、未授权片段拒绝、注入抵抗、冲突消解和受扰动任务成功;正文写明分母和不确定性在配套表中,未在本节列出这些分母(第 4.7 节)。语义标注使用两名主标注者和一名裁决者,384 对上的 κ 为 0.834(第 4.7 节,附录 B.5)。
  6. 总结一下论文的主要内容

    EC-Agent 把主张、片段、执行前缀和来源状态绑成可重放回执,并把完整性与语义支持分开判定。

    EC-Agent 为工具智能体的审计增加一份可重放的联合回执:它同时绑定发出的主张、精确来源片段、有序执行前缀,以及该次执行看到的来源版本和访问状态。

    • 问题:单独合法的引用和单独合法的轨迹仍可能被移植到另一条主张、另一次运行或另一个来源版本。作者把最小可审计单元写成(发出的主张、来源片段、来源版本、有序执行前缀),并假设记录器在执行期间受信任。
    • 做法:发射锚点用事件下标、字段和半开区间定位主张,并以 SHA-256 校验子串。域分隔的执行摘要在答案事件之后计算,再与主张哈希、锚点、证据引用和清单合成联合承诺。完整性决策 Vint 与词法、冲突感知、NLI、语言模型或人工支持评估器分开;oracle 标签只在包重放和执行重跑之后接合。
    • 替换抵抗:1,280 次跨对象攻击中检出 1,275 次(0.9961),false-rejection rate 为 0.0031。引用加独立轨迹在主张移植上为 0.1797,加共享 run ID 为 0.2266。去掉一项针对性性质后,对应检出降到 0.0156–0.0625(Figure 2)。144/144 次结构篡改被拒绝,16/16 次词法对抗被接受。
    • 语义与效用:384 对上冲突感知守卫 F1 0.8865、false acceptance 0.0729,对照词法重叠的 0.8019 和 0.3229;标注 κ = 0.834。未见失败族上该守卫 F1 0.8679、false acceptance 0.0938,覆盖 0.4479,低于词法重叠的 0.5781。Table 6 中该守卫任务成功 0.7278、联合重放 0.9976;动态评测的注入抵抗为 0.9078,受扰动任务成功为 0.8127。128 条标题复制筛查上,三种发证策略的协议字段均为 1.0000,匹配成本比无证书多 3.0 个声明 token 和一次验证器调用。
    • 作者的结论:完整性平面说明发出并绑定了什么,支持平面说明被绑定的证据是否支持该主张。作者同时写明,该保证依赖受信任的 runner 与 observation logger,标题派生筛查不衡量语义泛化,开放语义偏移和被攻破的记录器还需要更多证据。
阅读原文arxiv.org