谁的事实才算数?对 LLM 评测基准的文化响应性审计
Whose Facts Count? A Culturally Responsive Audit of LLM Evaluation Benchmarks
AI 导读
研究者用文化响应性评估(CRE)框架的六维评分表审计了 OpenAI 的 SimpleQA(4,326 项)和 LMSYS Chatbot Arena(600 段对话)。SimpleQA 每题都要求以英语档案作为证据基础,单一评分者对哥伦比亚建国日期的偏好占 2.70% 的题目,夸大了全球南方覆盖度;Arena 中英语提示词占 76.3%,而 ITU 估计全球网民中英语用户仅占 25.9%。一个 50 项反基准的 CR 缺陷均值比 SimpleQA 低近三倍(Cohen's d = 1.01),论文认为这属于结构性效度失效。