跳到正文
原文
Failure-First·· 14 天前

DocOps:面向复杂文档操作自主智能体的可验证基准

[Daily Paper] DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

AI 导读

研究者提出 DocOps,一个用容器化 Harbor bundle 交付的基准,用于测量智能体在电子表格、演示文稿和 PDF 等原生格式文档操作中的完整性与可靠性,并按操作(内容、格式、结构)与难度(L1 原子到 L4 跨文档状态追踪)两轴分类。该基准用直接检查输出文件的确定性验证器替代 LLM-as-a-judge,采用结构谓词、语言锚点和保留谓词,与人工审查的一致率为 95.31%;在针对 36 份已验证输出的 180 次受控变异压力测试中,检出 96.67% 的违规。

阅读原文failurefirst.org