评测与基准arXiv 2609.15315
安全强化学习评测指标:SafeRLEval 开源评测套件
提出 SafeRLEval,用越界率与代价偏差评测安全强化学习
- arXiv
- 2609.15315
- 发表
- 场景
- 具身与机器人
- 被测模型
- PPO-Lag、P3O、FOCOPS
摘要SafeRLEval 用越界率、归一化偏差和安全等级补充 E[C]≤d,并要求同时看贪心部署。
Spoor、Plaat 与 Moerland 认为,安全强化学习沿用 CMDP 的 E[C]≤d,只报告平均是否安全,看不出越界频率和幅度,也分不清训练期、带探索噪声的最终策略和贪心部署策略。他们提出评测框架 SafeRLEval:越界率 V、按安全界归一化的平均代价偏差 Dnorm、只在越界回合上计算的归一化幅度 Dnorm+。用 IQM 跨任务和安全界聚合。