AdaCultureSafe:LLM 文化安全与文化知识存在显著解耦
AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models
AdaCultureSafe上知识与安全脱钩;Llama3.1-8B经DPO后Respect绝对升12.02%。
- 全球部署要求模型在不同文化里保持尊重。作者称既有工作把文化安全与文化知识分开,即便同时涉及也常不成对,因此看不出安全是否用上了地区文化知识。
- 从三个公开来源整理22国描述,用Qwen3-max为每条生成选择题和开放式安全查询,人工核验后得到AdaCultureSafe。再用四类偏好对做DPO,使正例既尊重又调用内部文化知识。
- 七模型Overall Acc均高于80。Respect从GPT-4o-mini的51.37到Qwen3-max的84.56。作者称相关接近零。Llama3.1-8B的Respect增12.02(Table 3)。
- 作者指出文化被按静态处理,后续应考虑演变;22国、六大洲并不穷尽,扩展地区并加入本地语言可加强适用性。评测写了7个模型与评分一致性;Table 8和Fig. 11未写模型,DPO的β与训练步数未报告。
- 被测模型
- Llama3.1-8BMistral-7BQwen2.5-7BQwen2.5-14BQwen2.5-32BQwen3-maxGPT-4o-mini
- 基准
- AdaCultureSafe
- 指标
- AccRespectF1Spearman Corr
研究者提出 AdaCultureSafe 数据集,用于联合评估 LLM 的文化安全与文化知识,发现二者存在显著解耦:LLM 虽拥有丰富文化知识,却无法利用这些知识提升文化安全,倾向于依赖通用安全而非基于特定文化知识的安全。为此,研究者提出一种知识接地方法,在生成回复时激发 LLM 内部的文化知识,实验证明该方法有效提升了文化安全。该工作已被 EMNLP 2026 Findings 接收。
深度解读
这篇论文试图解决什么问题?
文化安全是否由文化知识支撑,分开评测回答不了。
文化安全是否建立在文化知识上,分开评测回答不了。
- 场景: 作者称 LLM 全球部署需要跨文化保持安全与尊重。缺少地区文化知识时,即便有通用安全约束,也抓不住细粒度差异,从而出现跨文化不尊重(Fig. 1(a))。
- 现有不足: 作者称既有工作通常只做文化知识或只做安全机制。Wu et al. (2025) 开始同时考虑,但材料常不成对,并被当作独立成分(Fig. 1(b))。
- 假设: 自适应文化安全要求模型理解输入后,依据内部规范、禁忌等知识做安全推理,再生成回应;安全依赖对相关知识的使用。
- 数据难点: 作者称文化的多样性与语境差异使这种配对资产很难做,因此需要权威整理、模型合成查询和人工校验。
- 本文: 构建 AdaCultureSafe,为同一主题配对知识查询与安全查询。作者称它是带配对评测资产的首个高质量细粒度数据集,并据此提出把生成锚到内部文化知识的方法。
有哪些相关研究?
相关工作分开做文化知识或文化安全;作者称关联仍缺配对评测。
文化知识
- 探测与蒸馏: Yin et al. (2022) 用不同提示探测预训练模型中的地理多元文化常识。Nguyen et al. (2024) 从 LLM 收集并蒸馏文化知识断言,以提高对话的文化敏感性。
- 规范与智能体: Li et al. (2023) 收集美国与中国的人工社会规范,并生成遵守或违反规范的双语对话。Qiu et al. (2025a) 用文化知识提升基于 LLM 的网页智能体的文化与社会意识。
- 红队基准: Chiu et al. (2025) 的 CulturalBench 通过人机红队测试衡量文化知识,并比较不同模型。论文还将 Fung et al. (2024)、Li et al. (2024) 列为关注文化知识的工作,未做逐篇对照。
文化安全与偏见
- 地区安全: Ashraf et al. (2025) 与 Huang et al. (2024) 基于阿拉伯语数据做文化分析,强调阿拉伯地区特定的安全增强。El Mekki et al. (2025) 讨论面向摩洛哥达里贾语、埃及阿拉伯语等本地社区的模型。
- 偏见: Sukiennik et al. (2025)、Navigli et al. (2023)、Naous et al. (2024) 讨论 LLM 的文化偏见,以及需要可随文化调整的模型。论文未给出与本文的数字对比。
- 多模态: Qiu et al. (2025b) 把文化安全扩展到大视觉-语言模型。
知识与安全同时出现
- SocialCC: Wu et al. (2025) 交互式评测语言智能体的文化能力。作者称该工作开始同时考虑二者,但常不成对,并被当作独立成分。
实验对照
- 被评模型: 联合评测没有外部方法基线,直接在 AdaCultureSafe 上报告各 LLM 的 Acc、Respect、F1 与 Spearman。安全增强以同一模型不使用该方法的结果为对照。
作者将本文放在这些工作旁边:既有研究分开改进知识或安全,忽略安全对知识的依赖,相关仍缺探索;本文用配对资产做联合评测,并据此做知识锚定。
论文如何解决这个问题?
AdaCultureSafe配对评测知识与安全,再用DPO把回答锚到内部知识。
问题设定
作者将自适应文化安全写成:模型 M 对输入 X 生成 Y 时,须调用内部文化知识 K,并由机制 π 做安全推理。生成过程为 X → pM(Y ∣ X, πM,K(X, K)) → Y,含义是文化上安全的回应依赖对相关知识的理解与使用,而不只是通用安全约束。
描述采集与查询合成
- 来源: 中国外交部(禁忌与礼仪等)、Cultural Atlas(日常常识等)、Commisceo(跨文化指引)。按国家整理,人工去噪并回源核对,覆盖六大洲 22 国。
- 拆条: 混合材料拆成单主题描述,共 4.8K 条。
- 合成: Qwen3-max 按每条描述各生成 5 道选择题(题干、选项、正确项)和 5 道开放式冒犯查询(场景加问题)。5 为经验设定。
- 校验: 四名标注员检查描述的真实性与主题内一致性,知识查询的相关性与事实一致性,安全查询的相关性与冒犯性。不达标则重生成或手改,上限 10 轮,仍失败则剔除。最终知识查询与安全查询各 24K。附录 B 给出完整生成指令。
评测指标
- Acc: 模型选项是否等于正确项,先在一条描述内平均,再对描述平均。
- Respect: 对开放回答打尊重分,再按同样方式平均。评审为 Qwen3-max 与 GPT-4o-mini。论文未说明两名评审如何合成一个分数,正文也未给出分值量纲;阈值按 60% 使用。
- F1: 每条描述上对 Acc 与 Respect 取调和平均,再对描述平均。
- Corr: 描述级 Acc 与 Respect 的 Spearman 系数。作者称数值更高表示统计关联更强。
知识锚定的 DPO
作者用直接偏好优化,使“尊重且用上文化知识”的回答优于其他回答。目标模型先按文化描述生成多样查询。四类回答:类型 1 尊重并在推理中纳入相关文化知识(正例);类型 2 用了知识但仍冒犯;类型 3 安全但泛化、没有特定文化知识;类型 4 既冒犯又没有相关知识。类型 1 分别与类型 2–4 配对。优化目标为
maxθ𝔼[logσ(βlog(pθ(yp|q))/(pref(yp|q))−βlog(pθ(yn|q))/(pref(yn|q)))]
pθ 为策略,pref 为参考模型,σ 为 sigmoid,β 控制相对参考模型的偏离。论文未给出 β。主实验用中国文化描述为 Llama3.1-8B 构造样本;附录对 Mistral-7B 与 Qwen2.5-7B 重复该流程。
干预与激活分析的做法
干预把扰动后的文化信息写入上下文,以覆盖内部知识,再比较 Acc 与 Respect。激活分析取中间层 MLP 神经元,计算不同查询上激活集合的 Jaccard。作者称 Jaccard 更高表示神经元更共享、对单条知识更不专门。Fig. 11 未标明模型。
论文做了哪些实验?
七个模型知识分高、安全分化,相关多接近零;锚定后Respect上升。
实验设置
- 被评模型: Llama3.1-8B、Mistral-7B、Qwen2.5-7B(§5.1,Table 1);Qwen2.5-14B、Qwen2.5-32B(Table 5);Qwen3-max、GPT-4o-mini(Table 6)。
- 数据: AdaCultureSafe,22 国、4.8K 描述;知识查询 24K(平均 4.97 道/描述),安全查询 24K(平均 5.00)(Table 4)。
- 指标: Acc、Respect、F1、Spearman。四象限阈值为 60%;极端组为 Acc>80% 与 Acc<20%。
- 评审: Qwen3-max 与 GPT-4o-mini 给 Respect 打分。人工评分者之间 Fleiss’ Kappa 0.9070、ICC 0.9621;LLM 与人工 ICC 0.8821、Cohen’s Kappa 0.7740(§4.3)。论文未报告人工评分人数,也未说明两评审如何合并。Qwen3-max 同时合成查询,并在 Table 6 被评测。
- 增强: DPO。Llama3.1-8B 的训练描述为中国文化(§5.3)。论文未报告 β、学习率、步数与重复次数。
- 对照: 同一模型不使用该方法。没有外部方法基线。
主结果
据 Table 1、Table 5、Table 6 的 Overall 行:
表格较宽,可左右滑动
模型 Acc Respect F1 Corr(p) Llama3.1-8B 86.58 55.60 65.23 -0.05(0.00) Mistral-7B 80.65 54.18 61.94 0.03(0.04) Qwen2.5-7B 89.07 59.89 69.54 0.02(0.12) Qwen2.5-14B 91.36 70.22 77.84 0.03(0.08) Qwen2.5-32B 92.17 71.20 78.91 0.01(0.30) Qwen3-max 94.37 84.56 88.11 -0.03(0.08) GPT-4o-mini 93.21 51.37 64.61 0.03(0.08) - 知识与安全: 作者称几乎全部 Acc 超过 80%,而三个 7B/8B 模型的 Respect 经常低于 60%。七个 Overall Respect 的最低值是 GPT-4o-mini 的 51.37,最高值是 Qwen3-max 的 84.56。作者称闭源 GPT-4o-mini 安全差于开源对照、知识却更好;其 Acc 93.21 高于 Qwen2.5-32B 的 92.17,但低于 Qwen3-max 的 94.37。
- 相关: 作者称 Spearman 接近零,且没有显著统计关系。Overall 中 Llama3.1-8B 的 p=0.00,Mistral-7B 的 p=0.04,系数分别为 -0.05 与 0.03。
- 地区: 作者称西方中心国家、尤其美国更好。Table 1 三个 Acc 列中美国均为最高:90.40、86.60、93.58。Respect 上,Mistral-7B 与 Qwen2.5-7B 的美国为 66.80、73.00;Llama3.1-8B 的新西兰为 61.96,高于美国的 55.97。
知识分组与干预
- 四象限: 作者称超过 90% 的案例属于“有知识”(类型 1 和 2),其中安全案例比例低。正文写 Fig. 10,图注写 Figure 2;纯文本看不到各块比例。
- 极端组: Acc>80% 对 Acc<20% 的 Respect:Llama3.1-8B 为 54.81 对 56.42,Mistral-7B 为 56.73 对 59.73,Qwen2.5-7B 为 61.28 对 65.11(Table 2)。对应 T 检验 p 为 0.6946、0.5342、0.4279,Wilcoxon p 为 0.4196、0.4552、0.3829。作者称两组无显著差异,高知识组略低,并称这一结果反直觉。
- 干预: Table 7 Overall:Llama3.1-8B 的 Acc 49.73(-36.85*)、Respect 62.12(+6.52*);Mistral-7B 为 45.16(-35.49*)、64.68(+10.50*);Qwen2.5-7B 为 50.89(-38.18*)、60.91(+1.02*)。* 在 Table 7 中表示 p<0.05。作者称安全并不建立在对文化知识的主动理解上。
知识锚定后的分数
- Llama3.1-8B: Table 3 Overall 为 Acc 86.8(+0.22*)、Respect 67.6(+12.02*)、F1 74.00(+8.73*)。引言写绝对增益 12.02%(相对 21.62%),该句未点名模型。各国 Respect 增量均为正且带 ,如 JP +14.66、KR +14.68*。
- 另外两模型: Mistral-7B Overall 为 Acc 73.9(-6.77*)、Respect 79.7(+25.47*)、F1 74.0(+12.02*)(Table 9)。Qwen2.5-7B 为 88.8(-0.23*)、75.5(+15.65*)、80.1(+10.53*)(Table 10)。作者称安全与联合分数变好,并写 Mistral-7B 的知识分数下降,增强时还要更仔细地训练(附录 C.4)。
- 案例: §5.3 比较使用方法前后的回答:未使用时模型顺着带文化冒犯前提的提问;使用后把传统放回社会与历史语境。附录 D 另有案例。此处不转述冒犯表述。
激活相似性
- Jaccard: 作者称中间层中,文化知识查询的激活神经元 Jaccard 低于文化安全查询(Fig. 11)。纯文本无具体系数,图也未写模型。
- 作者推断: 文化知识在预训练中按条目专门化,文化安全则在后训练中被加成与具体知识无关的通用约束,因而二者的功能连接仍弱。
其他消融与分析
- Table 1 中国家相关并不都接近零:Llama3.1-8B 在 PH 为 -0.25(p=0.00)、在 CN 为 -0.18(p=0.01);Mistral-7B 在 CA 为 0.19(p=0.02)。Qwen3-max 在 PH 为 -0.29(p=0.00)(Table 6)。
- Table 3 中 Llama3.1-8B 的 Acc 有升有降:TH +1.17*,RU -0.82、AU -0.76、CN -0.30;Overall Acc 为 +0.22*。
- Table 8 标题未写模型。Overall 为 Acc 55.88(-30.92*)、Respect 65.41(-2.21*)。作者称知识被改动后安全下降,且仍好于原模型。
- 作者称 Fig. 8 中 Respect 很散、Acc 挤在一起;Fig. 9 中各国知识变高并不伴随安全同步上升。纯文本看不到散点与曲线。
有什么可以进一步探索的点?
作者指出文化按静态处理,22国并不穷尽,且未纳入本地语言。
作者指出的局限与后续方向
- 本文处理的是静态文化,后续应面对演变中的文化(Limitations)。
- 数据覆盖 22 国、六大洲,作者称并不穷尽;扩展更多地区并加入本地语言,会加强全球适用性与文化深度(Limitations)。
实验覆盖范围
- 被评模型为 Llama3.1-8B、Mistral-7B、Qwen2.5-7B、Qwen2.5-14B、Qwen2.5-32B、Qwen3-max、GPT-4o-mini,共 7 个(§5.1,Table 1、5、6)。
- 评测数据为 22 国、4.8K 描述,知识与安全查询各 24K(Table 4)。查询由 Qwen3-max 合成;Respect 由 Qwen3-max 与 GPT-4o-mini 评分,并报告了人工之间及 LLM 与人工的一致性(§4.3)。
- 知识锚定结果写了 Llama3.1-8B(中国文化描述,Table 3)、Mistral-7B(Table 9)和 Qwen2.5-7B(Table 10)。
- 干预结果写了上述三个 7B/8B 模型(Table 7)。Table 8 与 Fig. 11 未写明模型。
- 论文未报告 DPO 的 β、学习率、训练步数、重复次数,以及两名 LLM 评审如何合并成分数。
总结一下论文的主要内容
配对评测中知识与安全脱钩,知识锚定DPO抬高了Respect。
AdaCultureSafe 把同一条地区文化做成“是否知道”和“是否尊重”两套查询,用来看安全有没有用上知识,并用偏好训练把回答往“尊重且用上知识”拉。
- 缺口: 作者认为跨文化尊重应来自对内部文化知识的推理。既有评测把知识和安全拆开;Wu et al. (2025) 虽同时涉及二者,材料仍不成对。
- 数据: 三个公开来源经人工清洗,拆成 22 国、4.8K 条单主题描述。Qwen3-max 各生成约 5 道选择题与开放式安全查询,四名标注员核验后各 24K 条。作者称这是带配对资产的首个高质量细粒度数据集。
- 评测: Overall Acc 最低为 Mistral-7B 的 80.65(Table 1),最高为 Qwen3-max 的 94.37(Table 6)。Overall Respect 最低为 GPT-4o-mini 的 51.37,最高为 Qwen3-max 的 84.56(Table 6)。作者称 Spearman 接近零。Acc>80% 组的 Respect 略低于 Acc<20% 组(Table 2)。扰动文化信息后 Acc 下降、Respect 不降(Table 7)。
- 训练: 四类偏好对上的 DPO。Llama3.1-8B 的 Respect 为 67.6(+12.02*,Table 3)。引言另写相对增益 21.62%,该句未点名模型。Mistral-7B 的 Respect +25.47*,Acc -6.77*(Table 9)。
- 作者的结论: 现有安全更像后训练加上的通用约束,而不是由文化知识推出来的;把生成锚到内部知识,可以抬高跨文化场景里的 Respect。