Google DeepMind 的 Aroyo 呼吁建立文化敏感的 AI 评测标准
Google DeepMind 对齐研究负责人 Lora Aroyo 在首尔 AI Festa 的 AI Summit Conference 主题演讲中表示,现有以英语为中心的评测体系无法反映各地法律、语言语境与文化规范,导致 AI 出现文化盲区。她指出,AI 模型已支持约 100 种语言,但主要基准默认使用英语,最多只评测 10 到 20 种语言;以任何形式评测文化差异的基准占比不足 20%,因此模型即便给出安全答案也可能在文化上不当。她将文化错误分为语言与文化规范、地方宗教与神话、历史、地缘政治四类,并举例说多数模型会认为把筷子直插米饭是安全的,而这在亚洲多国违反当地礼仪。她还观察到同一英语问题译成马来语后答案准确率降至 50%,译成泰米尔语降至 40%,译成韩语时文化适当性错误率高于新加坡、印度、台湾、孟加拉国和巴基斯坦。