AIR-BENCH Live 发布:可自动更新的基础模型安全基准
AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models
AI 导读
研究者提出 AIR-BENCH Live,作为 AIR-BENCH 2024 的自更新后继版本,通过自动监测政府监管、将新政策条款归入现有风险分类或提出新类别,并用多智能体、人格驱动的提示词生成算法产出多语言提示词。当前版本将基准从 314 项细分风险扩展到 335 项,新增 21 个类别,来自七个司法辖区的 31 条全新政策条款。对 14 个近期模型的评测显示安全表现差异较大(按模型自身行为判定为 0.17 至 0.89),更新后的提示词平均比 2024 版难 0.06 分,降幅集中在最顺从的模型上,且多数模型在非英语提示词上安全性略低。