评测与基准arXiv 2609.28335
研究者发布面向 EU AI Act 行为准则的系统性风险指数与仪表盘
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
- arXiv
- 2609.28335
- 发表
- 层
- 模型层
- 场景
- AI Agent
- 测试
- Claude Sonnet 5、Claude Haiku 4.5、GPT-5.6 Luna Pro 等 15 个
- 风险危险能力
构建 Systemic Risk Index 流水线,把公开基准映到四类系统风险并评测
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 RevLeakBench 测量交付物修订痕迹造成的无意泄露
修订痕迹指模型按要求删掉或换掉一项后,又在交代这次修改时把它写进给第三方的交付物。
提出 SafeRLEval,评测安全强化学习策略的越界与代价偏差
Spoor、Plaat 与 Moerland 认为,安全强化学习沿用 CMDP 的 E[C]≤d,只报告平均是否安全,看不出越界频率和幅度,也分不清训练期、带探索噪声的最终策略和贪心部署策略。他们提出评测框架 SafeRLEval:越界率 V、按安全界归一化的平均代价偏差 Dnorm、只在越界回合上计算的归一化幅度 Dnorm+。用 IQM 跨任务和安全界聚合。