FAR.AI 发布 AI 安全排行榜与护栏最低标准 1.0
FAR.AI评估前沿模型CBRNE及网安防御,Grok 4.5与Gemini 3.1 Pro现通用越狱,另两模型未破。
- 63Grok 4.5 随机搜索下通用越狱数(Figure 1)
- 18Gemini 3.1 Pro 随机搜索通用越狱数(Figure 1)
- 385Grok 4.5 专家引导下通用越狱数(Figure 1)
前沿AI模型在高危领域的防御水平参差不齐,论文旨在建立基线测试标准并量化通用越狱风险。
论文梳理了越狱攻击技术、防御分类器机制以及高危能力评测三类相关工作,定位本文为最低静态防御基准。
论文提出了包含67个原语的越狱分类法,构建了双重危害数据集,并通过三阶段漏斗评测识别通用越狱。
评测覆盖4家厂商旗舰模型,Grok 4.5与Gemini 3.1 Pro暴露大量通用越狱,Claude与GPT均未失陷。
作者指出了数据集双重用途歧义、评审漏报及静态局限,实验未覆盖动态自适应攻击和真实能力提升。
论文系统评测了前沿模型对已知静态越狱的防御能力,揭示了厂商间防护鲁棒性的巨大分化。