跳到正文
原文
论文追踪· arXiv:2609.24934· Fatima Tuz Zahra, Md. Sajeebul Islam Sk., Rachel Chung·本站收录 · 原文发表

谁的事实才算数?对 LLM 评测基准的文化响应性审计

Whose Facts Count? A Culturally Responsive Audit of LLM Evaluation Benchmarks

AI 导读

研究者用文化响应性评估(CRE)框架的六维评分表审计了 OpenAI 的 SimpleQA(4,326 项)和 LMSYS Chatbot Arena(600 段对话)。SimpleQA 每题都要求以英语档案作为证据基础,单一评分者对哥伦比亚建国日期的偏好占 2.70% 的题目,夸大了全球南方覆盖度;Arena 中英语提示词占 76.3%,而 ITU 估计全球网民中英语用户仅占 25.9%。一个 50 项反基准的 CR 缺陷均值比 SimpleQA 低近三倍(Cohen's d = 1.01),论文认为这属于结构性效度失效。

阅读原文arxiv.org