跳到正文
原文
论文追踪· arXiv:2609.34862· Zhiqiang Wang, Yichao Gao·本站收录 · 原文发表

JEV 作为智能体轨迹安全评判器:与生成式 LLM 评判器的实证对比

JEV as a Judge for Agent Trace Security: An Empirical Comparison with Generative LLM Judges

AI 导读

研究对比了类型化决策模型 JEV 与四个生成式 LLM 评判器在智能体轨迹安全分类上的表现,测试覆盖四个基准共 5,219 条轨迹。JEV 的基准平均正类 F1 为 77.8,高于最强生成式配置 GLM-5.2 的 74.1,有效结果覆盖率分别为 95.5% 和 94.4%。JEV 在 ATBench500 和 MCPHunt 上领先,GLM 在 R-Judge 和 TraceSafe 上领先;JEV 成功调用延迟中位数 0.99 秒,每次有效判断的 token 成本平均约 $0.000195。

阅读原文arxiv.org