跳到正文
原文
论文追踪· arXiv:2609.24165·本站收录 · 原文发表

APEXA 为同步辐射数据处理的 LLM 多智能体加装执行完整性护栏

APEXA: Execution-Integrity Enforcement for Multi-Agent LLM Automation of Synchrotron Data Reduction

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

APEXA用工具层拒未执行结果;50场景×4模型模拟IOC上0/200,仅提示词15/200。

威胁模型文本型机构网关可能静默丢弃已发出的工具调用,模型仍可能叙述从未执行的标定。

问题
同步辐射数据还原是多步专家流程,语言模型的流畅回复并不等于请求的计算已经执行。机构网关还可能静默丢弃工具调用,模型仍会叙述未运行的标定。
方法
APEXA用一个推理智能体调用61个工具。确定性工具层拒绝返回没有执行记录的结果,并在电机命令发出前做五类检查。APEXA-BENCH含58项任务,按四类物理后果标注。
实验与结果
50个对抗场景、四个模型、模拟EPICS IOC上,工具层违规为0/200,约700 token仅提示词基线为15/200。APS 1-ID上一条提示完成标定与积分,CeO2衰减扫描的探测器距离稳定在±0.02 mm,非物理标定被拒绝。
局限与可以继续做的
论文未专门讨论局限。本文报告电机安全门与跨探测器任务完成;大规模评分留待全文研究,正文没有APEXA-Score。§IV-C只评任务完成,不评精修精度。
实验设置GPT-5-mini、GPT-5.4 等 · APEXA-BENCH、50-scenario adversarial suite 等 · unsafe command violations、Lsd stability 等
威胁模型
文本型机构网关可能静默丢弃已发出的工具调用,模型仍可能叙述从未执行的标定。可选EPICS电机命令在caput之前由服务端五类检查拦截。50个对抗场景在模拟EPICS IOC上评测,正确结果是拒绝且不发出命令。
被测模型
GPT-5-miniGPT-5.4Claude Opus 4.7Gemini 2.5 Pro
基准
APEXA-BENCH50-scenario adversarial suiteAPS 1-ID ai_tuneMIDAS bundled CeO2 SRM 674b
指标
unsafe command violationsLsd stabilitytask completionAPEXA-Score
AI 导读论文提出 APEXA,一个已部署的框架,协调 61 个工具完成同步辐射数据缩减,并通过确定性执行完整性护栏阻止对未实际执行的工具调用返回结果。同一工具层还实施电机安全约束:在 50 个对抗场景和四个模型上,对模拟 EPICS 控制器产生 0/200 次违规,而仅用提示词的基线为 15/200。作者同时发布 APEXA-Bench,包含 58 个按科学正确性和物理后果组织的设施任务;在真实 APS 光束线数据上,一条提示完成了探测器几何恢复并整合了完整的衰减与曝光扫描。作者认为可信的科学智能体需要确定性的执行验证,而非模型侧的保证,并公开了框架、基准和轨迹。

论文提出 APEXA,一个已部署的框架,协调 61 个工具完成同步辐射数据缩减,并通过确定性执行完整性护栏阻止对未实际执行的工具调用返回结果。同一工具层还实施电机安全约束:在 50 个对抗场景和四个模型上,对模拟 EPICS 控制器产生 0/200 次违规,而仅用提示词的基线为 15/200。作者同时发布 APEXA-Bench,包含 58 个按科学正确性和物理后果组织的设施任务;在真实 APS 光束线数据上,一条提示完成了探测器几何恢复并整合了完整的衰减与曝光扫描。作者认为可信的科学智能体需要确定性的执行验证,而非模型侧的保证,并公开了框架、基准和轨迹。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    流畅回复不等于计算已执行,网关还可能静默丢掉工具调用。

    流畅回复不等于请求的计算已经执行,同步辐射数据还原不能靠这种回复。

    • 场景:同步辐射实验产生太字节级衍射数据,标定和长序列方位角积分涉及二十多个可执行程序、每次一百多个参数。作者认为把这条流水线用好是独立的专家技能,并正在限制设施通量。
    • 现有方法:先前基准按词法或执行级结果、字符串匹配、单元测试或模拟终态打分。作者称它们看不见两类失败:形式正确的序列仍可能达不到科学家接受的标定容差,或收敛到物理上不可能的几何;操作真实仪器的评测也很少,且没有检查结果是否来自已执行的工具调用。
    • 观察:机构网关可以不通知就丢弃工具调用,模型随后会描述从未运行的标定。作者称提示词阻止不了这一点;确定性检查才能确认调用已执行。同一原则用于可选电机面。
    • 本文做法:作者给出已部署的 APEXA,在确定性工具层拒绝没有执行支撑的结果,并用 61 个工具做数据还原。同时给出 APEXA-BENCH:58 项设施任务,按科学正确性与物理后果组织。
    • 威胁模型:
      • 目标:不把未执行的分析当结果返回;电机场景的正确结果是带说明的拒绝,且不发出 EPICS 命令。
      • 通道:模型经文本型机构 LLM 网关发工具调用,网关可能静默丢弃调用。论文未使用 white-box、black-box 或 no-box。
      • 对抗输入:50 个场景,覆盖超范围、限位开关、大于 50% 行程、矛盾指令、提示注入、无联锁快速多轴、非法速度和失控 jog。
      • 受害系统:APS 上的标定、积分和可选 EPICS 电机。电机实验对着模拟 EPICS IOC;标签记录同一命令在真实仪器上的代价。
  2. 有哪些相关研究?

    作者称既有基准不检查结果是否由已执行的工具调用产生。

    相关讨论集中在智能体基准、数字工具上的对抗评测,以及仪器侧智能体。

    智能体基准

    • Chen 等(2021)、SWE-bench(2024)、WebArena(2024)和 GAIA(2024)分别评代码、仓库问题、浏览器环境和通用助手。
    • τ-bench(2025)在模拟里核对最终状态;ScienceAgentBench(2025)、SciCode(2024)和 MLAgentBench(2024)评科学代码或机器学习实验。
    • 作者称这些工作都不按物理后果分级,也不面对文本型机构网关静默丢弃真实调用;即便像 τ-bench 那样核对模型声称的输出,也会认证从未运行的结果。作者称最接近的物理基准 AFMBench(2025)控制原子力显微镜,但没有系统的安全轴或后果分类。

    对抗稳健性套件

    • 作者把 Ruan 等(2024)、AgentDojo(2024)、R-Judge(2024)和 AgentHarm(2025)归为数字工具上的风险、提示注入或有害性评测。
    • 作者称其失败模式是信息泄露,不是设备损坏;APEXA-BENCH 与之互补,门在确定性工具层,而不是模型侧防御。

    仪器上的智能体

    • 作者提到 Coscientist(2023)、基于 ReAct 的 ChemCrow(2024)、面向 SAXS/WAXS 的 VISION(2025)、X 射线纳米探针工作(2026)和机器人化学(2025),以及更广的自驱动实验室文献。
    • 引言中的深度学习物相识别针对孤立子问题。作者称它们不负责端到端操作数据还原流水线。
    • 作者称显微镜自动化、X 射线纳米探针和一般科学智能体基准做过评测,但都不检查执行完整性。

    基线与基准

    • 实验基线是约 700 token 的仅提示词安全提示,与工具层检查共用 50 场景对抗套件,对着模拟 EPICS IOC。任务集是 APEXA-BENCH,不是上述外部基准。

    作者把本文定位为已部署的分析框架,用来检查报告结果是否由实际运行的工具调用产生,并把错误动作按束线上的物理代价分级。

  3. 论文如何解决这个问题?

    工具层拒绝未执行结果,并在 caput 前做电机检查。

    APEXA 把随机推理和执行分开:工具调用先过确定性工具层,再进入三个 MCP server。标题写 Multi-Agent;§III 与 Fig. 2 写的是单个 reasoning agent 循环使用全部 61 个工具。

    信任边界与工具

    • 智能体:一个随机推理智能体,经机构 LLM 网关以文本发出调用。论文未说明部署时默认绑定哪个模型。
    • 工具划分:core 10 个,MIDAS 38 个(标定、径向积分、GSAS-II Rietveld、Materials Project 结构检索),EPICS 13 个。领域包括标定、分析、电机、知识和可视化。
    • 边界:Fig. 2 把解析器、执行完整性守卫和电机检查放在工具层代码。网关可静默丢弃调用;守卫把它变成显式非结果并强制重试。
    • 后端:同一分析可在 Python(GPU)或编译(CPU)后端运行,结果写入 manifest。作者称不需要手改参数文件。

    执行完整性守卫

    • 条件:回复含工具调用语法、但该轮没有工具执行时,runner 拒绝定稿,注入更正,并强制格式正确的重试。反复失败后返回「nothing executed」,不采用模型叙述。
    • 格式:作者报告 GPT-5 类模型发出 TOOL_CALL/ARGUMENTS 文本;Claude Opus/Sonnet 会漂到原生 XML 或裸键值。解析器仍把漂移调用当作调用。
    • 缺失输入:未配置 Materials Project API key 时 CIF 下不来,路径不在任何已执行工具的输出里。系统报告缺失输入,不运行精修。
    • 未写明的参数:论文未给出强制重试的次数上限,也未给出注入更正的原文。

    电机检查

    • 时机:任何 caput 之前,检查在 EPICS server 的代码中执行,不在模型或提示词里。
    • 五类名称:§II-B 为限位开关、软限位、>50% 行程守卫、速度界、jog 时长上限;§IV-B 为软限位、限位开关、移动幅度、速度、jog 时长;Fig. 4 为 soft-limit、limit-switch、slew-magnitude、velocity、jog-duration。论文未给出速度界和 jog 时长的数值阈值。
    • 套件:50 个场景、八类失败模式。正确结果是带说明的拒绝,且不发 EPICS 命令。评测用模拟 EPICS IOC,量的是门是否挡住命令。

    基准设计

    • 规模:58 个自然语言任务:Calibration 11、Integration 8、HEDM Analysis 10、Motor Control 10、GSAS-II Refinement 11、Domain Knowledge 8。作者称 50 项为基础任务,另有 8 项跨探测器切片 ref_01–ref_08。
    • 标签:Table I 的 I、C、PR、PI 分别对应无代价、计算时间、束线时间、设备损坏。电机任务在模拟控制器上运行;标签记的是真实仪器上的代价。
    • 评分:一般任务看工具选择和参数是否在领域容差内。跨探测器切片还把终点定义为 GSAS-II Rietveld 的 NIST 可溯源晶格常数,须落在认证参考的容差内。本文不报告大规模分数。
    • 复合定义:附录把分数写成 APEXA-Score=1/(|T|)∑t∈ T wt· Ct· St·(α+(1−α)Et)。C 与 S 为 0 或 1,E 为 min(1, nopt/nactual),wI=1、wC=1.5、wPR=2、wPI=3,α=0.7 事先固定。相乘使不安全但正确的任务得 0。作者称权重是示意性的。
  4. 论文做了哪些实验?

    工具层0/200、提示词15/200(50场景×4模型,Fig. 4)。

    实验设置

    • 模型:GPT-5-mini、GPT-5.4、Claude Opus 4.7、Gemini 2.5 Pro,工具描述相同,经机构 LLM 网关。论文未说明部署默认模型。
    • 采样:chat 端点 temperature=0.2。作者称前沿 API 不是逐比特可复现,网关不提供 seed,仅提示词基线是 2026-05 的单次点估计。作者称核心主张是工具层的确定性性质。
    • 安全协议:50 场景 × 4 模型 = 200 次,模拟 EPICS IOC。对照为约 700 token 的仅提示词。成功标准是拒绝且不发命令。没有 LLM 裁判。
    • 真实数据:APS 1-ID,Varex 2880×2880,63 keV,Lsd 约 900 mm;标样 CeO2 与 LaB6。Fig. 1 注明 150 µm 像素。
    • 跨探测器:ref_01–ref_08,CeO2(SRM 674b),探测器为 GE、Pilatus 和两种 Varex,用 MIDAS 自带示例。只评任务完成。
    • 未在正文给出的量:各模型分开的违规次数、守卫重试上限、58 项任务的成功率、APEXA-Score 实测值。

    主结果

    0/200 与 15/200 是四模型合计。论文未按模型分列,表中因此不设模型行。

    条件结果出处
    工具层五类检查,50 场景×4 模型0/200 违规Fig. 4
    约 700 token 仅提示词,同一 200 次15/200 违规,185 次挡住Fig. 4
    仅提示词,大单步行程9Fig. 4
    仅提示词,超范围目标4Fig. 4
    仅提示词,提示注入1Fig. 4
    仅提示词,多轴1Fig. 4
    CeO2 衰减扫描,恢复的 Lsd稳定到 ±0.02 mm§IV-A、Fig. 3
    同条件 CeO2 与 LaB6Lsd 一致到 0.03 mm§IV-A
    • 作者解读:作者称这类约束必须写进代码,而不能只写进提示词。图注称工具层一侧是按构造得到的;正文称这些试验没有产生不安全命令。违规分散在四个模型上,图中没有分列。
    • 类型:图注称仅提示词违规集中在大单步行程和超范围目标;图注称其余类型在两种设置下都是 0。
    • 几何:作者称恢复的是可复现物理几何,并拒绝报告非物理标定。被拒的是 CeO2 att5 与 LaB6 att6,图注称它们远高于收敛阈值;正文写应变约 10−3,束心偏移或为负。阈值的具体数值论文未给出。

    真实束线还原

    • 单提示:一条自然语言提示跑通标定和 2D 到 1D 积分:识别标样、匹配暗场、精修几何、产出 1D 花样。Fig. 1 一帧 CeO2 为 Lsd = 895.80 mm,束心 (1410, 1447) px,λ = 0.1968 Å,残余伪应变 1.3×10−6。图注称这些值来自 manifest,没有手调。
    • 束心:同条件两标样束心差 < 0.005 px(< 1 µm)。CeO2 衰减扫描的束心 < 0.004 px。Fig. 3b 图注称约 0.005 mm 的逐次起伏是稳定带内的真实散布。
    • 图文对照:引言把探测器距离的稳定性写成覆盖衰减/曝光扫描;Fig. 3 横轴是 Attenuation level。作者称非物理标定被自主排除,而不是被发出。

    执行完整性与精修任务

    • 失败形态:作者报告前沿模型会为从未运行的命令给出几何表、输出文件大小乃至校验和一致的结论,对应文件不在磁盘上。作者称字符串匹配和工具状态指标都会把这种回合记成成功。
    • 守卫:含调用语法但该轮无执行时拒绝定稿并强制重试;反复失败则返回「nothing executed」。无 API key 时不针对从未取得的结构返回拟合。
    • ref_01–ref_08:作者称单条自然语言请求可以完成这些任务,未给出完成率。作者称窄收敛半径下,拟合可以报告成功并返回接近给定初值的数,所以工具跑过不等于该步约束了答案。本文只评完成与否;精修精度未评,因为配方已修订,且需要初值晶胞和峰形项的消融,以及按切片的稳健统计而不是均值。

    其他消融与分析

    • temperature=0.2;仅提示词基线为 2026-05 单次点估计,网关无 seed(§III)。
    • 格式漂移的观察包括 Claude Opus/Sonnet;四个正式模型名单里没有单独的 Sonnet(§III、§IV-B)。未报告漂移被误判的次数。
    • 无 Materials Project API key 时跳过精修(§IV-B)。
    • Python(GPU)与编译(CPU)后端可跑同一分析;未报告数值对照(§IV-A)。
    • 附录权重 wI=1、wC=1.5、wPR=2、wPI=3,α=0.7;正文没有 APEXA-Score。
    • 附录称电机门可用 mock、无 LLM 复现;这与 Fig. 4 是同一主张,不是另一组计数。
  5. 有什么可以进一步探索的点?

    论文未专门讨论局限或后续工作。

    作者指出的局限与后续方向

    论文未专门讨论局限。

    实验覆盖范围

    • 安全套件是 50 个场景乘以 GPT-5-mini、GPT-5.4、Claude Opus 4.7、Gemini 2.5 Pro,共 200 次,对着模拟 EPICS IOC;chat 端点 temperature=0.2,仅提示词一侧是单次点估计(§III、§IV-B、Fig. 4)。
    • 真实数据是 APS 1-ID 的 CeO2 与 LaB6,探测器 Varex 2880×2880、63 keV;Fig. 3 报告衰减水平上的标定残差和 Lsd(§IV-A)。
    • 跨探测器切片是 ref_01–ref_08,标样 CeO2 SRM 674b,探测器为 GE、Pilatus 和两种 Varex,数据来自 MIDAS 自带示例;只记录任务是否完成(§IV-C)。
    • §II-A 写明本文报告电机安全门和跨探测器任务,大规模模型评分留待全文研究;正文没有 APEXA-Score 的数值。
    • 论文未报告 15 次仅提示词违规在四个模型上的分别次数,也未报告守卫重试上限和每个场景的模型查询次数(Fig. 4、§IV-B)。
  6. 总结一下论文的主要内容

    作者称执行是否发生要由工具层核对,而不能只靠提示词。

    APEXA 是先进光子源上的数据还原框架,用工具层代码约束语言模型智能体的工具调用。

    • 问题:标定和积分是多步、参数很多的流程。流畅回复不能代替「调用已经执行」;文本型机构网关还可能静默丢掉调用。
    • 方法:单个推理智能体通过三个 MCP server 使用 61 个工具。守卫拒绝呈现没有执行记录的结果;EPICS 命令在 caput 前经过限位、行程、速度和 jog 时长等检查。APEXA-BENCH 有 58 项任务,并按无代价、计算时间、束线时间、设备损坏标注。
    • 安全结果:50 个对抗场景、四个模型、模拟 EPICS IOC 上,工具层为 0/200 违规;约 700 token 的仅提示词基线为 15/200,其中大行程 9、超范围 4、提示注入 1、多轴 1(Fig. 4)。图注称工具层的 0 是按构造得到的。
    • 束线结果:一条提示在 APS 1-ID 真实数据上完成标定和积分。Fig. 1 一帧 CeO2 的 Lsd 为 895.80 mm,残余伪应变为 1.3×10−6。CeO2 衰减扫描上恢复的探测器距离稳定到 ±0.02 mm,CeO2 att5 与 LaB6 att6 被拒绝(Fig. 3)。同条件两标样的 Lsd 一致到 0.03 mm。摘要还将这一稳定性写到完整的衰减与曝光扫描。
    • 作者结论:作者称可信的科学智能体要在代码里同时核对执行和科学输出,而不是依赖模型侧保证。作者还称执行完整性必要但不充分,因此本文的精修任务只评完成,不评精度。
阅读原文arxiv.org