跳到正文
原文
论文追踪· arXiv:2610.05830·本站收录 · 原文发表

研究提出智能体排行榜污染审计框架,并检验评分器有效性

HAL

AI 导读

研究者提出按证据区分训练暴露、评测检索与运行流程泄漏的审计框架,并审查九种 HAL 配置。作者报告,27项渠道评估均未能确认为封闭,但只在四种配置中确认污染事件。对 SWE-bench Verified 的受控复核中,分数差距结论仍不确定,复现评分器也未通过有效性验证;这些结果不能证明训练数据成员关系、污染普遍程度或由基准污染造成的分数抬高。

阅读原文arxiv.org