Harness-IF:评估编码 Agent 跨指令面的指令遵循能力
Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
AI 导读
研究者提出 Harness-IF,用于评估编码 Agent 在多个指令面上的规则遵循情况,并区分真正遵循与碰巧符合默认行为。该基准包含 60 个真实多轮编码任务,取自 642 条规则库,256 条规则获得判定,分布在部署 Agent 会读取的五个可配置指令面上。为区分遵循与巧合,作者提出 Against-Prior Accuracy(AP-Acc),只对与模型无提示默认行为相反的规则打分,通过九次探针构建中隐去规则重跑任务来观测。在 12 个前沿模型上,准确率为 72.1% 至 85.9%,AP-Acc 为 66.1% 至 78.6%,所有模型在反先验规则上表现更差,差距 3.6 至 7.4 个百分点,平均 5.81。作者指出聚合分数会以模型相关的幅度高估遵循程度。