跳到正文
原文
arXiv:对齐与欺骗· arXiv:2609.11028· Shenghan Zheng·· 22 天前

BenchShield:面向 LLM Agent 评测基础设施的奖励完整性形式化插桩

BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure

AI 导读

论文提出 BenchShield,一个以形式化模型为支撑的插桩层,用于保障 LLM Agent 评测中的奖励完整性。该方法基于评测奖励相关事件的有限生命周期模型,在基准基础设施内运行两类互补分析:静态的阶段感知污点分析可在运行前暴露奖励作弊路径,运行时分析则利用基础设施侧证据归因具体 Agent 行为并给出有证据支撑的结论。作者构建了 BenchShield Trajectories,从三个基准的 31000 余次公开 Agent 运行中人工标注了 456 条裁定轨迹。

阅读原文arxiv.org