跳到正文
原文
FAR.AI·· 2025-07-18

Mind the Mitigation Gap:为何 AI 公司必须同时报告缓解前与缓解后的安全性评估

Mind the Mitigation Gap: Why AI Companies Must Report Both Pre- and Post-Mitigation Safety Evaluations | FAR.AI

AI 导读

FAR.AI 指出多数 AI 公司只披露缓解前或缓解后其中一类安全评估,导致风险难以准确衡量,主张两者都必须上报。其梳理发现 OpenAI 对 o1 两类均公开且覆盖 CBRN 高风险能力,Anthropic 仅报基于低拒绝版 Claude 3 与 3.5 的缓解前能力且无明确定义,Gemini 1.5 仅有缓解后评估,Meta 对 Llama 3.1 只给模糊声明,阿里 Qwen-2.5 仅有基础缓解后评估,DeepSeek R1 则完全没有报告。该框架应用于 o1、GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro 后发现,WMDP-Chem 准确率上 o1 与 GPT-4o 最高达 70–75%,危险请求合规率上 GPT-4o 高达 50%。

阅读原文far.ai