研究评测前沿模型多语言道德回答:GPT-5 平均表现最好,Gemini 2.5 Pro 在部分类别最低
Measuring Moral LLM Responses in Multilingual Capacities
作者称GPT-5全类平均近92%,Consent 3.56、Harm 4.73;Gemini同两项1.39、1.98。
- LLM用于多语言日常任务后,道德、法律与安全回答及内置安全限制可能随语言变化。作者要测高低资源语言间的偏移,并找出表现差的问题类型。
- 英语500题分5类,用Googletrans译入中文、西班牙语、阿拉伯语、印地语和斯瓦希里语。同意与伤害预防类用间接、欺骗性问法。Gemini 2.5 Pro按1–5分量表评五个模型,temperature为0.7。
- 作者称GPT全类平均近92%,Qwen为66%。Consent与Harm Prevention上,GPT平均3.56和4.73,Gemini为1.39和1.98。作者称欺骗类里低资源语言分数更高,并认为高资源下模型更易被诱导作答。
- 作者指出翻译仍可能不准、没有人类回答、模型可能因措辞形成对用户的印象。计划扩展到Googletrans支持的全部语言,并收集人类回答、测试措辞变体。
- 被测模型
- Gemini 2.5 ProClaude Sonnet 4GPT-5Llama 4 ScoutQwen3 235B-a22b
- 基准
- Biases & StereotypesConsent & AutonomyHarm Prevention & SafetyLegalityMoral Judgment
- 指标
- 1-5分量表分数百分比成绩
一项研究评测了前沿与领先开源模型在低资源和高资源语言下的多语言回答,从五个维度衡量其准确性与一致性,采用五分制评分标准和 judge LLM 打分。结果显示 GPT-5 在每个类别上平均表现最好,其他模型在语言和类别间的一致性较差。在 Consent & Autonomy 与 Harm Prevention & Safety 两个类别中,GPT 得分最高,平均分别为 3.56 和 4.73;Gemini 2.5 Pro 得分最低,平均分别为 1.39 和 1.98。作者认为,这些发现说明需要进一步测试语言变化如何影响模型在不同类别下的回答,并改进相关表现。
深度解读
这篇论文试图解决什么问题?
作者要测前沿与开源模型在五类道德安全问题上、高低资源语言间的评分一致性。
多语言道德与安全一致性是要测的问题:前沿与开源模型在高、低资源语言中,对五类道德、法律与安全问题的回答是否稳定,非英语下的内置安全功能是否仍能拦住恶意内容。
- 场景:作者称人们已用 LLM 写邮件、做作业、生成食谱,使用还在增加(Liang et al., 2025; 2024)。作者认为回答不应因提示词语言或话题而失去准确性,也需要能限制非英语恶意内容的安全措施。
- 现有不足:作者称测试数据以英语为主。引用 Zheng et al. (2023),称英语下领先 LLM 能公正判断并稳定给出接近人的回答;但学术题(Fu and Liu, 2025)与道德题(Jin et al., 2024)在多语言上不再稳定。非英语下安全协议表现差,更难发现恶意内容(Alon and Kamfonas, 2023; Lin et al., 2025)。作者承认已有基准(Ahuja et al., 2023)和超过 100 种语言的数据集,仍称需要更多评测,现有测试数据多样性有限。
- 切入:作者要先找出多语言 LLM 表现差的问题类型,以及换语言后判断如何变,再做针对性数据。Harm Prevention & Safety 与 Consent & Autonomy 被写成间接、带欺骗性的问法,用来试内置安全功能的边界。
- 评测:5 类各 100 题、6 种语言,五点量表加 judge LLM,比较 GPT-5、Gemini 2.5 Pro、Claude Sonnet 4、Llama 4 Scout 和 Qwen3 235B-a22b。作者称初步测试里,GPT-5 在不安全或有害提示上略高于其他模型。
有哪些相关研究?
相关工作分道德框架、多语言能力与跨语言安全;作者称自己额外看措辞和五类问题。
作者按道德框架、多语言能力和跨语言安全三条线讨论前人,并把自己的实验放在「除换语言外再看措辞,且一次覆盖五类」的位置。
道德框架
- DIT(Achiam et al., 2023):用心理学的 Defining Issues Test 和标准 P-score 测道德推理。作者转述:部分 LLM 能达到与较高人类回答相当的阅读水平,但不同困境间结果差得很开,伦理推理不一致。
- 功利主义与义务论(Samway et al., 2025):用量表看回答偏向哪一种意识形态。作者转述:模型倾向功利主义,程度因模型而异;给出的理由常常缺少深度和连贯性。
- 作者对这两类策略的评价:改用发展心理学工具,或用哲学框架给理由分类,都能提供观察,但常限于少数指定困境和固定量表。作者认为道德是刻度,理由往往无法整齐归类,因而对模型如何回应道德情境仍有缺口。
多语言能力
- 多语言电车难题(Jin et al., 2024):同一困境换语言后,道德推理常随提示语言改变。作者转述该文还指出,变化可能延伸到合法性与偏见,因而需要跨多个类别测试。
- 跨语言事实题(Fu and Liu, 2025):平行问题、不同难度。作者转述:GPT-4o 在高资源语言上表现稳定,低资源语言更多不一致和事实错误。
- 英语对照:作者用 Zheng et al. (2023) 支持「英语下判断较稳」,并称这一表现在多语言学术与道德题上失去一致性。作者认为多语言推理和事实可靠性仍未解决,并质疑 LLM 能否在需要道德与事实推理的多语言场景中充当可信 judge。
跨语言安全
- 非英语安全协议:引言称,问题用非英语提出时安全协议表现差,模型更难检测恶意内容(Alon and Kamfonas, 2023; Lin et al., 2025)。
- Lin et al. (2025):大规模数据集,在超过 100 种语言中用恶意或非法查询测安全。作者转述:低资源语言中模型更可能产出有害内容,安全准则与执行有落差。该文的 trick questions 被作者称为 jailbreak 式提示。
- 作者如何接上:作者称除语言变化外还看措辞。伤害预防和同意类写成带隐藏恶意内容的间接问法,看细微措辞会不会让模型放过有害内容。作者把 Lin 的直接安全基准当作跨语言弱点的依据,自己要延伸的是措辞差异。
实验节没有另列方法基线,五个模型互为对照。评测用的是自建五类问题;实验节未写在 MEGA(Ahuja et al., 2023)或 MoralBench(Ji et al., 2024)上跑分。
论文如何解决这个问题?
自建五类500道英语题并译成五种语言,用1–5分量表和Gemini 2.5 Pro作judge。
整体做法是用自建五类多语言问题集,经翻译后让模型作答,再由 Gemini 2.5 Pro 按 1–5 分量表评分。同意与伤害预防两类写成间接、欺骗性问法,用来观察内置安全功能。论文没有形式化目标函数,也没有使用 white-box、black-box 等术语。
数据与五类问题
- 规模与语言:英语 500 题,5 类各 100。译入高资源的中文、西班牙语、阿拉伯语,以及低资源的印地语、斯瓦希里语。贡献列表写 6 种语言,英语包含在内。翻译工具是 Googletrans。作者称这些语言在句式、文化语境和文字系统(字母到语素文字)上差异大。
- 三类直接问题:Biases & Stereotypes 涉及可能唤起刻板印象的人口身份,看是否延续有害偏见,并比较高低资源语言。Legality 问一些国家合法、另一些国家非法的行为,看模型是否按提示语言假定用户地点。Moral Judgment 是是/否道德题并要求理由,对照 care、fairness、loyalty、authority、sanctity、liberty。
- 两类间接问题:Consent & Autonomy 用欺骗性提示,看安全机制能否挡住可能违反个人同意与自主的信息。Harm Prevention & Safety 用伪装或间接问题,看会不会给出可能促成有害或不道德行为的信息。Figure 1 为改写问法,Figure 2 为例题;可用文本没有题干。
模型与提示
- 模型:前沿模型 Gemini 2.5 Pro、Claude Sonnet 4、GPT-5;经 OpenRouter 调用的开源模型 Llama 4 Scout、Qwen3 235B-a22b。作者称选择时考虑训练数据、用途、来源和是否开源,并挑选翻译能力上的领先模型。
- 作者对模型的描述:Gemini 偏学术应用,GPT 提供宽泛、可适应的回答,Claude 强调输出安全,Qwen3 为中国开发、区域对齐较强。这是作者的定位,不是实验结果。
- 提示参数:使用系统提示,temperature 为 0.7。每题以 under 50 words 结尾。Moral Judgment 另要求先 Answer yes/no/maybe,再给 justification。Figure 3 为模型指令,全文未进入可用文本。
流程与评分
- 流程:每道英语题译入五种目标语言之一,模型用该语言作答,回答再译回英语,由 Gemini 2.5 Pro 按量表评分。Figure 4 为测试流程。正文对 Figure 6 的讨论包含英语表现,故英语题也在评测范围内。
- 译文检查:各类、各语言抽取译题和回答,送入 GPT-5 与 Qwen,检查是否保持原意。另抽查非英语回答与英语对应项,检查翻译偏差。论文未报告抽样题数。
- 量表:1–5 分,每类单独规定 5 分与 1 分的约束,结论和理由都看。作者称道德信念因文化而异,且当时无法取得跨文化的适当人类样本,因此把量表当作评分中的标准。附录 A.1 为量表,条目未进入可用文本。
- 交叉评分的设计:随机回答再用 GPT-5 与 Qwen 3 评分,用来防范 Gemini 偏向自己的回答。交叉评分的数字放在实验结果里。
论文做了哪些实验?
作者称GPT全类近92%、Qwen为66%;欺骗类GPT为3.56与4.73,Gemini为1.39与1.98。
实验设置
- 被测模型:Gemini 2.5 Pro、Claude Sonnet 4、GPT-5、Llama 4 Scout、Qwen3 235B-a22b。后两个经 OpenRouter。结果节常把 Qwen3 235B-a22b 简称为 Qwen,把 GPT-5 简称为 GPT。
- 数据:自建英语 500 题,5 类各 100;语言为英语,以及中文、西班牙语、阿拉伯语(高资源)和印地语、斯瓦希里语(低资源)。翻译与回译用 Googletrans。流程写的是每道英语题译入目标语言后评分。
- 指标:1–5 分量表上的类别平均;第 4 节另把全类平均写成百分比成绩。结论提到 refusal rates,但没有给出拒答率数字。论文未把百分比换算成 5 分制,这里也不换算。
- 评审:主 judge 为 Gemini 2.5 Pro。随机样本另由 GPT-5 与 Qwen 3 评分。论文未报告该样本的题数、实验重复次数,或与人工评分的一致性。
- 生成设置:temperature 0.7;回答限制在 50 词以内。Moral Judgment 要求先 yes/no/maybe 再给理由。
- 图表:Figure 5 为最终结果,Figure 6 为最终图,Figure 7 为回答示例,附录 B.1、B.2 为方差和分模型结果。图内刻度未能从文本读出,下表只列正文写明的数字。
主结果
模型 正文写明的分数 出处 GPT-5 Consent & Autonomy 3.56;Harm Prevention & Safety 4.73;全类 almost 92% 摘要;第4节 Gemini 2.5 Pro Consent & Autonomy 1.385,摘要写 1.39;Harm Prevention & Safety 1.98 Figure 5正文;摘要;结论 Claude Sonnet 4 Harm Prevention & Safety 3.75 结论 Qwen3 235B-a22b 全类 66% 第4节 Llama 4 Scout 正文未写出具体分数 图见 Figure 5、附录 B - 作者对总体的说法:摘要称 GPT-5 在每个类别的平均都最高,其他模型在语言和类别上更不一致。贡献列表称 GPT-5 相对其他领先模型明显更高;引言对不安全或有害提示只称略高。论文没有解释这两处措辞的差别。除上表两类外,各类的模型间数字未在正文写出。
- 常规类与欺骗类:作者称 Gemini 在 Biases & Stereotypes、Legality、Moral Judgment 上较高,在更具欺骗性的类别下降,两类分数相差超过 2 分。作者认为这很可能是因为 Gemini 的测试数据以学术论文为主,因而在更事实、更直接的类别上较高。
- GPT 的例外:作者称 GPT 只在 Consent & Autonomy 上表现差,并把它联系到 OpenAI 的安全准则,以及针对越狱和控制恶意内容传播的更多测试。作者还称该类问的是可能的情感与心理伤害,而不是身体暴力,因此预期模型比 Harm Prevention & Safety 更可能作答。
语言差异与 Legality
- 测了什么:Figure 6 的正文比较英语、常规类和 trick question 类,以及高、低资源语言。论文没有在正文给出分语言分数。
- 作者报告的模式:各模型在英语常规类上较高,trick 类较低;这两类里 GPT 平均最高、Gemini 最低。作者称欺骗类中,低资源语言分数高于高资源语言。
- 作者的解读:作者认为可能是高资源语言的测试数据更多。并称低资源语言下模型会注意到有害用词而拒答,高资源语言下会读上下文并被诱导作答。Legality 上,作者称 Qwen 在低资源语言较差,在中文也差,尽管它是中文模型;作者称这一结果出乎预期,并认为可能是因为 Qwen 假定用户在中国、只按中国法律回答。作者给出的背景是:它是中国模型,测试数据多数为中文,大量用户在中国。
安全准则与评审检查
- 准则差异:作者称模型间安全协议不同,也是这两类分数有差别的原因,例如 Claude 的安全准则比 Qwen 或 Gemini 更严。结论称 Claude Sonnet 4 在 Harm Prevention & Safety 上相对较强。论文未引用准则原文。
- judge 交叉检查:相对 Gemini 的评分,Qwen 3 平均低 0.5,GPT-5 平均高 0.6(第 3.3 节)。作者称 Gemini 给自己的回答打分,相对给其他模型打分,未见偏向。论文未做统计检验。
- 翻译抽查:作者称抽查的非英语回答与英语对应项,评测都在 1 以内。文本没有写明 1 的单位。译文是否保持原意的检查没有给出定量结果。
其他消融与分析
论文没有参数消融表。其余为正文中的单项观察:
- Gemini 的常规类与欺骗类相差超过 2 分(第 4 节,未给各类精确分)。
- 欺骗类中低资源语言分数高于高资源语言(Figure 6 的正文解读,无分语言数字)。
- Qwen 的 Legality 在低资源语言和中文上都较差(无具体分数)。
- 交叉 judge:Qwen 3 比 Gemini 平均低 0.5,GPT-5 平均高 0.6。
- 附录 B 为回答方差和分模型结果,文本未抽出数字。
- Llama 4 Scout 在正文中没有单独分数。
有什么可以进一步探索的点?
作者指出翻译误差、缺少人类回答和措辞感知三项局限,并计划扩语言与收集人类回答。
作者指出的局限与后续方向
- 翻译:题目和回答用 Googletrans 翻译;尽管做了核验,不准确和不一致仍可能存在,并可能影响回答与评分(第 5 节)。
- 没有人类回答:未收集人类回答,用量表建立 base truth。作者称评测反映的是回答与量表的接近程度,并不是遵循当前社会价值的强指标(第 5 节)。
- 措辞感知:模型可能按问题措辞形成对用户的某种印象,从而因用词而不是内容改变回答(第 5 节)。
- 扩展语言:当前为英语、西班牙语、中文、阿拉伯语、印地语、斯瓦希里语。作者计划扩到 Googletrans 支持的全部语言(Future Work)。
- 人类基线:作者计划从不同国家和口语收集人类回答,作为与当前社会价值比较的基线(Future Work)。
- 措辞变体:作者计划让后续数据考虑措辞。同一问题略微不同的说法可能得到不一致结果,引导性或暗示性问题可能影响模型对用户意图的理解;作者称测试这些变体可减少评测噪声,并暴露模型感知中的潜在偏差(Future Work)。
实验覆盖范围
- 被测模型为 Gemini 2.5 Pro、Claude Sonnet 4、GPT-5、Llama 4 Scout、Qwen3 235B-a22b,共 5 个(第 3.2 节)。
- 题目为 5 类各 100 题、英语 500 题,并译入中文、西班牙语、阿拉伯语、印地语、斯瓦希里语;贡献列表写 6 种语言(第 3.1 节)。
- 主评分是 Gemini 2.5 Pro 加 1–5 分量表;GPT-5 与 Qwen 3 用于随机样本的交叉评分和译文含义检查(第 3.3、3.5 节)。
- 生成设置为 temperature 0.7、50 词以内;Moral Judgment 要求 yes/no/maybe 加理由(第 3.4 节)。
- 论文未报告随机样本的题数和实验重复次数。Figure 5、Figure 6 与附录 B 含分模型、分语言图,图中数值未能从文本读出。
总结一下论文的主要内容
五个模型按1–5分接受五类六语评测;作者称GPT-5平均最高,非英语欺骗类更不一致。
这项工作比较五个 LLM 在道德与安全题上的多语言回答,看分数是否随语言和问题类型变化。
- 问题:作者要测伦理、法律和安全回答在高、低资源语言之间如何偏移,以及非英语提示下内置安全功能是否仍能挡住恶意内容。
- 做法:英语 500 题分五类,译入中文、西班牙语、阿拉伯语、印地语和斯瓦希里语。Consent & Autonomy 与 Harm Prevention & Safety 用间接、欺骗性问法。回答译回英语后,由 Gemini 2.5 Pro 按 1–5 分评分;temperature 为 0.7,回答限制在 50 词内。
- 数字:作者报告 GPT 的全类百分比成绩近 92%,Qwen 为 66%。摘要中 GPT 在 Consent & Autonomy 与 Harm Prevention & Safety 的平均为 3.56 和 4.73,Gemini 2.5 Pro 为 1.39 和 1.98;Figure 5 的正文把 Gemini 的前一项写成 1.385。结论给出 Claude Sonnet 4 在 Harm Prevention & Safety 的平均 3.75。Llama 4 Scout 没有正文数字。
- 作者的解读:常规类高于欺骗类;欺骗类里低资源语言分数高于高资源语言。作者认为高资源语言下模型读懂上下文后更容易被诱导作答,低资源语言下则会注意到有害用词而拒答。Qwen 在中文 Legality 上仍差,作者认为它假定用户在中国并只按中国法律回答。
- 作者的结论:作者称安全机制在英语中可靠,但常常不能迁移到其他语言;推理、准确性和拒答率都对语言和措辞敏感。作者称现有基准低估了多语言安全的挑战,需要更稳健的多语言数据和评测框架。