FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿AI大模型在CBRNE与网络高危滥用领域的安全防护,提出了FAR.AI最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。
建立越狱原语分类与双重危害基准,评测模型抵御常见越狱的能力
本研究针对前沿AI大模型在CBRNE与网络高危滥用领域的安全防护,提出了FAR.AI最低安全标准(Minimal Standard v1.0)及配套评测基准,系统量化了当前主流模型的防护鲁棒性。