评测与基准arXiv 2608.03070
FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
- arXiv
- 2608.03070
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 等 8 个
摘要论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。
本研究针对前沿 AI 大模型在 CBRNE 与网络高危滥用领域的安全防护,提出了 FAR.AI 最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。