跳到正文
原文
论文追踪· arXiv:2607.22671· Rohan Naphade, Minzhou Pan, Bo Li·本站收录 · 原文发表

AIR-BENCH Live 发布:可自动更新的基础模型安全基准

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

AI 导读

研究者提出 AIR-BENCH Live,作为 AIR-BENCH 2024 的自更新后继版本,通过自动监测政府监管、将新政策条款归入现有风险分类或提出新类别,并用多智能体、人格驱动的提示词生成算法产出多语言提示词。当前版本将基准从 314 项细分风险扩展到 335 项,新增 21 个类别,来自七个司法辖区的 31 条全新政策条款。对 14 个近期模型的评测显示安全表现差异较大(按模型自身行为判定为 0.17 至 0.89),更新后的提示词平均比 2024 版难 0.06 分,降幅集中在最顺从的模型上,且多数模型在非英语提示词上安全性略低。

阅读原文arxiv.org