AI Security Leaderboard 发布:四个前沿模型的越狱成本相差上百倍
AI Security Leaderboard: Methodology, Results and Minimal Standard
AI 导读
独立基准 AI Security Leaderboard 发布 v1.0 报告,按 FAR$.$AI Minimal Standard 对前沿模型的护栏从弱到强排名,测试范围覆盖 CBRNE(化学、生物、放射、核与爆炸物)严重滥用请求和进攻性网络安全。报告测试了四个领先模型:Claude Fable 5 和 GPT-5.6 Sol 抵御了所有攻击,未发现通用越狱,作者估计用该方法越狱的成本可能超过 14200 美元;而 Grok 4.5 和 Gemini 3.1 Pro 存在数百个通用越狱,每个成本不到 300 美元,Grok 最弱的网络安全领域越狱成本低至 24 美元。
推荐理由
该榜单在同一最小标准下横向比较四个前沿模型的越狱成本,并指出所有弱点都已有现成防御,便于评估方理解当前护栏差距。