跳到正文
原文
arXiv:越狱、提示注入、投毒与防御· arXiv:2610.07362· Shai Feldman, Yaniv Romano·本站收录 · 原文发表 日期未标

HARP:在硬资源约束下为 LLM 评测动态分配预算

Dynamic Budget Allocation for LLM Evaluation under Hard Resource Constraints

AI 导读

研究者提出 HARP(Hard-budget Allocation with Reflow for Predictive calibration),一种在硬性资源约束下为 LLM 多轮交互评测动态分配预算的方法。该方法把评测建模为时间到事件问题,即产生越狱成功或智能体任务完成等目标事件所需的交互步数,并在算力有限导致轨迹被提前终止、事件时间仅被部分观测(删失)的情况下自适应重新分配未用预算。作者证明 HARP 不会超出目标预算,其下预测界(LPB)具有有限样本覆盖保证,且指标估计无偏。在智能体任务成功、LLM 越狱、有害内容生成和 RAG 幻觉等实验上,HARP 的覆盖率接近名义水平且方差较低,同时始终不超出给定预算。

阅读原文arxiv.org