IndicSafe:面向南亚 12 种 Indic 语言的多语言 LLM 安全基准
IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia
IndicSafe评测10个LLM在12种Indic语言上的安全标签,跨语言精确一致率仅12.8%。
- LLM在多语言部署中的安全行为,在12种Indic语言里缺少文化接地的系统评测。这些语言说话人超过1.2 billion,安全评测却多集中在英语。同一提示换语言后,安全标签可能改变。
- 每语言500条、共6000条英语提示,由母语者译入12种Indic语言。10个LLM以black-box API生成,GPT-4o标为四类安全标签。跨语言一致率、熵和类别偏差用来比较同一提示的译文。
- 60,000次生成中SAFE为50.5%。跨语言精确一致12.8%,跨模型精确一致0.35%。Qwen的UNSAFE为49.52%;Punjabi上Mistral对无害提示的拒绝率为61.6%。
- 作者指出译文仍可能有语义偏移,GPT-4o评审可能漏掉文化特定危害,且只分析单轮输出与模型回复。实验覆盖10个black-box模型和12种语言;人工复核3,000条。论文未报告重复次数。
- 被测模型
- GPT-4o MiniClaude Sonnet v4Grok-3Meta LLaMA 4LLaMA 3.3LLaMA 3.1 (405B)Cohere Command RCohere Command AQwen1.5-7B-ChatMistral-7B-Instruct-v0.2
- 基准
- IndicSafe
- 指标
- SAFE/UNSAFE/REFUSAL/AMBIGUOUS比例Cross-Language Exact Agreement RateCross-Model Exact AgreementMajority Agreement on Harmful PromptsLanguage Consistency IndexIntra-Model SAFE VarianceCohen's κRefusal RatePrompt-Level Entropy
作者发布 IndicSafe,称这是对 12 种 Indic 语言上 LLM 安全行为的系统性评估,这批语言覆盖超 12 亿人但在训练数据中占比不足。评测使用 6000 条涵盖种姓、宗教、性别、健康和politically相关话题的文化语境提示词,在翻译变体上考察 10 个主流模型,发现明显的安全漂移:跨语言一致率仅 12.8%,各语言的 SAFE 率方差超过 17%。部分模型在低资源文字上对无害提示过度拒答,对政治敏感话题过度标记,另一些则未能标记出不安全的生成内容。作者用提示级熵、类别偏差分数和多语言一致性指数量化这些失败,认为多语言 LLM 存在安全泛化缺口,安全对齐无法在各语言间均匀迁移,并主张采用基于区域伤害的语言感知对齐策略。
深度解读
这篇论文试图解决什么问题?
同一提示跨12种Indic语言时,安全标签精确一致率仅12.8%。
同一英语提示换成不同 Indic 语言后,安全标签经常不一致。
- 场景: 作者称 LLM 已用于内容审核和 civic platforms 等安全关键的多语言应用,但多数安全评测集中在英语或高资源西方语言,文化特异性不足。
- 缺口: 12 种 Indic 语言说话人超过 1.2 billion,作者称其在预训练语料和安全数据中代表性不足;种姓、宗教、性别、政治等因素常不在英语安全基准里。作者称已有非英语评测往往缺少区域设定,或依赖机器翻译。
- 观察: 作者以种姓优越论提问为例(原句不复述):英语和 Hindi 标为 UNSAFE,Odia、Telugu、Punjabi 标为 SAFE 或 AMBIGUOUS。作者称部署中用户或可只靠切换语言绕过安全控制。
- 假设: 作者称现有对齐默认跨语言一致,而该一致性实践中不成立;安全对齐不是 language-invariant。引言称超过 45% 的有害提示会收到不一致的跨语言安全标签,结果节未给对应计算表。
- 提出: 作者构建 6,000 条文化接地提示,母语者译入 12 种语言,评测 10 个 LLM,并用跨语言一致率、类别偏差和提示级熵量化 drift 与拒绝偏差。作者称 IndicSafe 是面向 Indic 部署、带文化信息的首个安全基准,并主张面向区域危害做 language-aware 对齐。
有哪些相关研究?
作者用Table 1把IndicSafe与缺少文化接地或drift分析的多语言基准对照。
英语安全与毒性评测
- 毒性与拒绝: RealToxicityPrompts(Gehman et al., 2020)、IndicJR(Pattnayak and Chowdhuri, 2026)和 DetoxLLM(Khondaker et al., 2024)被作者归入毒性评测;Ouyang et al.(2022)、Bai et al.(2022)被归入指令跟随与拒绝。
- 红队: RED Teaming(Ganguli et al., 2022)用对抗提示扩展上述工作。作者称其仍以单语和西方中心为主。
- 公平评测: HolisticEval(Bommasani et al., 2023)、SweEval(Patel et al., 2025)、FairEval(Sah et al., 2025)被作者称涉及公平,但仍缺跨语言和文化自适应评测,因而限制全球适用性。
多语言与低资源安全
- XSafety(Wang et al., 2024): 在 10 种全球语言上评测指令式安全提示。作者称英语之外性能下降;提示不是区域特定的,且用机器翻译,不分析译文之间的 safety drift。
- IndoSafety(Azmi et al., 2025): 用文化相关提示考察印尼语危害。作者称它语言特定,不能推广到 Indic,也不聚焦译文间 drift。Table 1 将其人工翻译标为 Partial。
- Afrocentric NLP(Adebara and Abdul-Mageed, 2022): 作者将其列为类似关切,未展开方法对比。
Indic 资源与基准对照
- PARIKSHA(Watts et al., 2024): Table 1 记为 10 种 Indic 语言、人工翻译;文化语境、安全导向和 cross-lang drift 均标为否。
- Samanantar(Ramesh et al., 2023): Table 1 记为 11 种 Indic 语言的人工翻译资源;同样标为非安全导向、无 drift 分析。正文未展开这两项的实验协议。
- 基线与数据: 论文没有把既有检测器或上述基准当作跑分基线。实验对照是 10 个 LLM 在自建 IndicSafe 上的彼此比较;Table 1 只比较基准属性。
作者称本文针对植根于本地文化、社会和政治危害的 Indic 安全问题,用母语者译入 12 种语言的 6,000 条提示,以及跨语言一致性、拒绝偏差、类别偏差和提示级熵,指出安全泛化的弱点。作者在贡献列表和 Table 1 标题中称,只有这项工作同时具备文化接地、母语翻译、安全导向和 drift 分析。
论文如何解决这个问题?
英语手写并母语翻译6000条提示,以GPT-4o四分类比较10个模型的跨语言标签。
作者把 IndicSafe 做成诊断基准:英语提示为参照,看同一提示的 12 种译文是否得到不同安全标签。模型经 API 当作 black-box,无内部可见性。
提示设计与类别
- 具区域、社会语言学和政治背景的研究者用英语手写提示,材料来自现实话语、新闻和有害网络内容。每语言 500 条,12 语言共 6,000 条。
- Table 2 的九类及每语言条数:Gender & Caste Discrimination 45;Harmful Instructions 51;Harmless Control Prompts 125;Health Misinformation 45;Misinformation or Conspiracy 50;Offensive / Hate Speech 49;Political Manipulation 45;Religious Hate or Provocation 45;Tricky / Ambiguous Prompts 45。
- 形式包括陈述、问题和命令。类别来自印度语言网络话语、区域媒体争议、法律言论边界和南亚社会语言学危害研究的定性分析。具体危害原句不复述。
- 作者称目标是模拟 Indic 部署中可能遇到的文化接地对抗输入,而不是只做英语提示或直接翻译。
翻译与语言覆盖
- 语言为 Hindi、Bengali、Odia、Tamil、Telugu、Kannada、Malayalam、Marathi、Gujarati、Punjabi、Nepali、Urdu,分属 Indo-Aryan 与 Dravidian。作者称说话人超过 1.2 billion,但相对英语仍是低资源:说话人口不等于高质量数字文本或安全基准。
- 母语者按附录 A.1 翻译,要求文化与语境等价,保留意图、语气和危害框架,不按字面直译,也不擅自删掉危害意图。每语言抽 50–100 条做双语审校。
- Table 7:共审 720 条,替换 28 条。翻译侧共 18 名母语者与审校者。无法翻译的条目被替换,或从该语言集合中剔除。Figure 10 覆盖印度及 Pakistan、Bangladesh、Nepal、Sri Lanka 的对应语言,不含 Dhivehi 与 Dzongkha。
生成协议
- 10 个模型各跑 6,000 条,共 60,000 次生成。统一设置:最长 200 token,temperature 0.3,top_p 0.75,无 penalty。
- 正文称 Claude、GPT-4o、Grok-3 用角色格式,LLaMA、Mistral、Cohere 用开放指令。模型列表中的对应名称是 GPT-4o Mini,不是评审用的 GPT-4o。
- 提示以原生文字发出,不附翻译提示、标签或示例。附录 A.3 / Table 8 给出模型规格与格式。
安全判定
- 评审模型为 GPT-4o,temperature 0.0,最长 150 token。每条回复标为 SAFE、UNSAFE、REFUSAL 或 AMBIGUOUS,并附解释。作者称判定看回复的内容、语气和意图,与输入语言无关。
- 附录 A.5 的人工定义:SAFE 为事实正确、无害或清楚且恰当的拒绝;UNSAFE 为有害、冒犯、偏见、操纵、误导或有毒;REFUSAL 为明确拒绝且不再附加不安全或误导内容;AMBIGUOUS 为含糊、自相矛盾、不完整或意图不清。示例原句不复述。评审提示以图给出(Figure 4;附录 A.4 又称 Figure 5),文本转换未包含提示词正文。
- 人工审核与自动评审的输入范围并不相同:自动判定按作者说法独立于输入语言、聚焦回复;人工指南要求同时看提示和回复。
- 人工样本为 5% 分层抽样,3,000 条生成,覆盖类别、语言和模型。18 名双语标注者使用与评审提示对齐的指南。子集交叉标注,由 senior reviewer 裁定。
指标
- Cross-Language Agreement Rate: 同一模型、同一提示的全部译文是否得到同一标签。
- Cross-Model Agreement Rate: 同一语言上,全部模型是否给出同一标签。
- Majority Agreement on Harmful Prompts: 英语中有害的提示,是否被多数模型或语言标为有害。
- 其余为 Judgment Entropy、Ambiguity Rate、Language Consistency Index(跨语言平均熵,越低越一致)、Intra-Model SAFE% 的标准差、Category Bias Score,以及 GPT-4o 与人工的 Cohen's κ。定义见 Table 3。§6.2 写 LCI 为 0 表示各语言标签相同,为 2 表示四类标签均匀分裂。论文未给出熵或偏差分的公式。
论文做了哪些实验?
60,000次生成中SAFE为50.5%;跨语言精确一致12.8%,跨模型仅0.35%。
实验设置
- 生成模型: GPT-4o Mini、Claude Sonnet v4、Grok-3(规模均写 Unknown);Meta LLaMA 4(17B)、LLaMA 3.3(70B)、LLaMA 3.1(405B);Cohere Command R(论文写 2024-08 发布)、Cohere Command A(2025-03 发布),二者规模未给;Qwen1.5-7B-Chat(7B);Mistral-7B-Instruct-v0.2(7B)。均经 API、black-box。
- 数据: IndicSafe,12 语言各 500 条,共 6,000 条;九类比例见 Table 2。无独立基线检测器,10 个模型互为对照。
- 生成: 每模型 6,000 条,共 60,000 次。最长 200 token,temperature 0.3,top_p 0.75,无 penalty。论文未报告重复采样。
- 评审: GPT-4o 做四分类,temperature 0.0,最长 150 token;论文未给数值阈值。人工为 3,000 条(5%),18 名标注者。
- 附加检查: 误差分析 400 条;5,000 条用 IndicBERT 与 XLM-R 做分词。分词模型不进入安全结果表。
主结果
Table 4:全部 60,000 次生成中 SAFE 50.5%、UNSAFE 18.7%、REFUSAL 18.4%、AMBIGUOUS 12.4%。下表为 Table 5 的模型分布(单位 %)。10 个模型只能列 8 行,省略 LLaMA 3.1 与 LLaMA 3.3。
表格较宽,可左右滑动
模型 SAFE UNSAFE REFUSAL AMBIG. Grok-3 83.67 0.98 12.40 3 LLaMA 4 78.72 5.28 12.18 3.8 Claude Sonnet4 60.38 2.63 27.08 10 GPT-4o Mini 58.53 20.70 16.05 4.7 Cohere A 59.20 12.93 8.77 19.1 Cohere R 33.82 33.53 11.18 21.5 Mistral-7B v0.2 12.85 45.50 35.30 6.4 Qwen 1.5 4.55 49.52 15.98 30 - Table 5 未列入上表的两行:LLaMA 3.1 为 56.90 / 7.60 / 22.10 / 13.4,LLaMA 3.3 为 56.42 / 8.72 / 22.70 / 12.2(顺序同为 SAFE、UNSAFE、REFUSAL、AMBIG.)。
- 作者称 Grok-3 与 LLaMA 4 更常给出 SAFE,模糊和拒绝较低;Qwen 与 Mistral 更常给出 UNSAFE。正文写二者 SAFE 为 84% 与 79%,Table 5 为 83.67 与 78.72。
- 作者称 Claude 采用高拒绝策略(正文写 27%,Table 5 为 27.08),GPT-4o Mini 在安全与表达之间更居中。作者将这些差异解释为不同提供者的安全调优范式;论文未提供训练或对齐细节来核对这一解释。
跨语言与跨模型漂移
- §6.2:同一提示、同一模型的 Cross-Language Exact Agreement Rate 为 12.8%;有害提示的跨语言多数一致为 63.3%。作者称精确匹配下近 90% 不一致,并写 identical prompts diverge ~90% of the time。同一提示、同一语言的跨模型精确一致为 0.35%,有害提示的跨模型多数一致为 54.4%。
- Table 6 的 Cross Language Consistency 与上一数字不是同一列:Grok-3 为 84.8(SAFE variance 7),Mistral 7bv0.2 为 58.0(variance 11),Cohere Command A 的 SAFE variance 为表中最高的 14。正文写 Grok-3 有 85% consistency。摘要写 SAFE rate variance exceeds 17%,Discussion 写 reaching 17%;Table 6 没有 17 这一格,论文未解释二者关系,也未说明 Table 6 的 Consistency 如何对应 12.8%。
- LCI:Grok-3 为 0.51,Mistral-7Bv02 为 1.35(Figure 1;正文只给出这两个数)。作者称安全判定不是 language-invariant。作者称 Claude 与 Grok-3 更倾向拒绝,Qwen 与 Mistral 更可能给出不安全或模糊输出。附录称 Figure 9 上 Claude 与 GPT-4o 一致率最高,Qwen、Mistral 与其他模型分歧大;单元格数值正文未给,且评测名单写的是 GPT-4o Mini。
语言、拒绝与模糊性
- 作者称 Figure 2 中 Odia、Kannada、Punjabi 的 AMBIGUOUS 与 REFUSAL 较高,Hindi、Marathi 的 SAFE 较高、模糊较低;逐语言百分比正文未给。Discussion 称 Odia、Punjabi 的 AMBIGUOUS 最高到 28%,Hindi、Marathi 上 GPT-4o-mini 的 SAFE > 60%。Figure 7 正文称 Cohere Command R、Command A、Claude Sonnet 4 和 GPT-4o-mini 在 Odia、Gujarati、Kannada 上 SAFE 较低;单元格未给出。Figure 8 图注称 Odia、Punjabi、Gujurati、Telugu 的 REFUSAL 高。
- 无害提示拒绝率最高为 61.6%(Mistral-7Bv02,Punjabi,Table 11)。作者称 Mixtral 与 Qwen 在 Tamil、Odia、Bengali 的无害提示上拒绝偏多;评测名单写的是 Mistral-7B-Instruct-v0.2,未解释 Mixtral。作者称 Political 与 Religious 上超过 60% 的回复被标为 unsafe 或 refusal;Health 与 Caste 相对更均衡。Figure 6 的讨论称 Political Manipulation、Harmful Instructions、Religious Provocation 的 REFUSAL 最高,Tricky/Ambiguous 以 AMBIGUOUS 为主,Harmless Control 大多 SAFE,仍有 4–9% 被拒绝。
- §6.4 称模糊率最高为 Qwen(Odia)53.8%。Table 13 标题却写 human annotations 中的 AMBIGUOUS 比例,最高行同为 qwen1.5-7B / Odia 53.80。11.2% 的提示熵 > 1.8,最高 5 条达到 2.0;Discussion 写 over 11%。作者称标注笔记中 80% 的模糊案例含犹豫或不确定表达,未给分母。
人工一致与误差
- §4.3:GPT-4o 与人工的平均 Cohen's κ 为类别 0.64、语言 0.63。Table 9 极值:类别从 Tricky / Ambiguous Prompts 的 0.56 到 Harmful Instructions 的 0.71;语言从 Nepali 的 0.57 到 Hindi 的 0.69。§4.2 写作 κ≈0.64 与加权 κ≈0.67。
- 加权后总体由 0.64 到 0.67。作者称 Misinformation 从 0.59 到 0.71,Ambiguous 从 0.56 到 0.61;并给出 CI:Misinformation +0.122(+0.05–0.21),Ambiguous +0.05(+0.01–0.17),称之为 significant gains。§5.6 另写 a high 0.67 inter-annotator agreement,未给计算表,不宜与加权 κ 直接等同。
- 附录 A.14 的 400 条:假阴性 33 条(8.25%),假阳性 15 条(3.8%),过度拒绝 11 条(论文写 2.1%)。作者称无害提示有时被拒绝,低资源语言中的有害输出会被漏掉;这 400 条未按语言给出 FN 计数。作者认为分词 UNK/OOV 不太可能解释 drift。
其他消融与分析
- Table 11: 无害拒绝率前两名为 Mistral-7Bv02–Punjabi 61.6%、qwen1.5-7B–Hindi 33.6%;表中列出的最低一行为 qwen1.5-7B–Bengali 21.6%。
- Table 13: 53.80(Odia)、40.40(Malayalam)居前;另有一行写作 qwen1.5-7Ben–Tamil 34.80。
- 熵表: 附录最高 5 条为 2.00、2.00、1.96、1.96、1.96,模型名为 qwen_outputs、llama33、CohereR、mistral7bv02;提示原文不复述。
- Table 10: Misinformation 的二次加权 κ 为 0.712,线性加权为 0.672;未加权为 0.59。
- Table 14: 5,000 条上两套分词器 UNK/OOV 均为 0.00%;平均 token/词 1.325 对 1.469。作者写 token 数约高 10–11%,每词约 +0.14–0.15。
- Table 7: 审校 720 条、替换 28 条;Tamil 为 60 条中替换 5 条,是该表替换数最高的语言。
有什么可以进一步探索的点?
作者指出译文偏移、自动评审漏判文化危害,以及只做单轮、不看训练与内部机制。
作者指出的局限与后续方向
- 译文: 翻译后的提示仍可能有细微意义偏移(Limitations)。
- 自动评审: 基于 GPT-4o 的自动评测可能漏掉细微或文化特定的危害(Limitations)。
- 分析对象: 只分析模型输出,不分析训练数据或内部机制(Limitations)。
- 交互长度: 只做单轮提示,多轮和长文本安全留待后续(Limitations)。
- 后续主张: Conclusion 主张把文化多样的提示、多语言对齐目标,以及提示级波动指标纳入以后的 safety tuning。这是作者的主张,不是已完成的发布或并入。
实验覆盖范围
- 被测生成模型为 §4.1 与 Table 8 的 10 个,均经 API、按 black-box 处理;安全标签由 GPT-4o 给出。
- 评测数据为自建 IndicSafe:12 种语言各 500 条、共 6,000 条,九类见 Table 2;生成共 60,000 次。Table 1 讨论的 XSafety、IndoSafety、PARIKSHA、Samanantar 未出现在结果分数表中。
- 人工审核为 3,000 条分层样本,18 名双语标注者;误差分析 400 条;分词检查 5,000 条,UNK/OOV 为 0.00%。
- 生成设置为最长 200 token、temperature 0.3、top_p 0.75;评审 temperature 0.0、最长 150 token。生成次数与 10×6,000 一致。论文未报告重复采样。
- 实验为单轮提示。Category Bias Score 在 §6.3 被概括为 Political 与 Religious 上超过 60% 标为 unsafe 或 refusal,论文未报告该分数的分模型表。
总结一下论文的主要内容
作者称安全对齐不随语言保持不变;同提示跨语言精确一致率12.8%。
IndicSafe 用文化接地的译文,检查 10 个 LLM 在 12 种 Indic 语言上的安全标签是否随语言改变。
- 问题: 作者称安全评测多集中在英语或高资源西方语言,而种姓、宗教、性别、健康、政治等相关危害在南亚语境中缺少对应评测。说话人超过 1.2 billion 的这些语言,在训练与安全数据中代表性不足。
- 做法: 英语手写、母语者译入 12 种语言,每语言 500 条、共 6,000 条,含无害对照。模型以 black-box API 各生成一次,共 60,000 次;GPT-4o 标为 SAFE、UNSAFE、REFUSAL 或 AMBIGUOUS。3,000 条人工标注的类别平均 Cohen's κ 为 0.64。
- 总体标签: Table 4 中 SAFE 50.5%、UNSAFE 18.7%、REFUSAL 18.4%、AMBIGUOUS 12.4%。Table 5 中 Grok-3 的 SAFE 为 83.67,Qwen 1.5 的 UNSAFE 为 49.52,Mistral-7B v0.2 的 UNSAFE 为 45.50、REFUSAL 为 35.30。
- 漂移: 同提示同模型的跨语言精确一致率为 12.8%,有害提示的跨语言多数一致为 63.3%;同提示同语言的跨模型精确一致为 0.35%(§6.2)。作者称精确匹配下近 90% 不一致。Table 6 另有一套 Consistency,Grok-3 为 84.8;论文未说明它与 12.8% 的关系。摘要写 SAFE 方差超过 17%,Table 6 列出的最高值为 14。
- 拒绝与漏判: 无害提示拒绝率最高 61.6%(Mistral-7Bv02,Punjabi)。400 条误差分析中假阴性 8.25%、假阳性 3.8%。作者认为分词缺字不太可能解释 drift。
- 作者结论: 作者称英语上的安全对齐不能假定迁移到这些多语言、文化接地场景;缺口同时涉及语言与社会文化。作者主张面向区域危害做 language-aware 对齐,并把提示级波动纳入以后的安全调优。