ROK-FORTRESS:用英韩转创矩阵测量地缘政治改写对国家安全与公共安全评测的影响
ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety
ROK-FORTRESS拆开英韩语言与美韩地缘,作者称文化无关任务上12/14模型韩语TRS更低。
- NSPS多语安全评测多用翻译,原场景和实体不变,因而分不清语言表面和地缘接地各自如何改变安全行为。
- ROK-FORTRESS有1,235个英韩任务,用转创矩阵组合英语/韩语与美国/韩国实体,以提示专属量规计算TRS,并比较去掉越狱包装后的直接请求。
- 作者称韩语变体在多数匹配比较中TRS更低,汇总语言降幅+10.21个百分点、情境降幅+4.47。直接请求下闭源平均语言降幅+4.5个百分点,五款开源为−6.0。
- 作者将经验发现限定在英韩与美韩轴,并把其他语言对的外部效度列为下一步。主评测为14个模型、1,235个任务;论文未报告每题重复采样次数。
- 被测模型
- OpenAI GPT-5.2OpenAI o4-miniAnthropic Claude Opus 4.5Anthropic Claude Sonnet 4.5Google Gemini 3 Pro PreviewLlama 4 Maverick InstructKimi K2 ThinkingQwen3 235B-A22BDeepSeek V3.2Mistral Large 3 (675B)LG K-EXAONE (236B/23B active)Upstage Solar Open (102B/12B active)Naver HyperCLOVA X Seed (32B)Kakao Kanana 2 (30B/3B active)Gemma-2-9BEXAONE 3.5-7.8BLlama 3.1-8B
- 基准
- ROK-FORTRESSMultiJail
- 指标
- TRSORSΔlingΔctx合规率F1Cohen's κ
研究者提出 ROK-FORTRESS,一个以英韩语言对和美韩地缘政治轴为案例的双语、文化对抗性国家安全与公共安全(NSPS)基准,通过转创矩阵把语言与地缘语境的影响分开考察。矩阵在英语与韩语、美国与韩国实体机构及操作细节的受控组合下评估对抗意图,每条对抗提示都配一条双用途良性对照以量化过度拒答,回答由经过校准的 LLM-as-a-judge 面板按专家编写的提示专属二元评分标准打分。在前沿模型与韩语优化模型的双轨测试中,韩语变体出现一致的抑制效应,地缘语境与语言的交互因模型而异,部分模型中韩国语境进一步缓解了语言驱动的抑制。剥离越狱包装的直接请求消融显示,闭源模型存在小幅但持续的下降,开源模型则表现出更大且依赖包装、方向相反的效果,作者认为韩语抑制的一部分来自提示特化而非语言本身的安全对齐。该转创矩阵方法设计上可推广到其他语言文化对。
深度解读
这篇论文试图解决什么问题?
翻译式评测分不清语言与地缘;ROK-FORTRESS用转创矩阵拆开二者。
安全评测难以把语言表面变化和地缘情境变化对NSPS行为的影响拆开。
- 场景:作者认为,针对国家安全与公共安全(NSPS)的大语言模型安全评测在增加,多语文献常把译入非英语、尤其是低资源语言当作攻击向量。翻译通常保留原威胁场景和实体,因此分不清失败来自语言表面还是地缘接地。
- 现有做法的缺口:作者认为,只改变固定场景表面形式的翻译或混语评测,测到的语言差不能外推到场景本身被本地化的转创设置。现有情境基准又常把语言和情境合在一起,或依赖自动生成。
- 初始假设:作者原假设韩国情境接地可能绕过西方中心的安全触发、提高有害遵从。跨模型看到的却是韩语变体上的抑制;地缘接地随模型既可能减弱、也可能放大语言驱动的抑制。
- 本文提出:以英韩语言对和美韩地缘轴为案例的双语、文化对抗基准ROK-FORTRESS,含1,235个按领域与文化特异性分层的任务;用转创矩阵做受控对比;用与NSPS严重度对齐的分层加权风险分(TRS);并比较去掉越狱包装的直接请求,以检验提示复杂度是否调节抑制。
有哪些相关研究?
相关工作多把翻译当攻击向量;作者用匹配意图的转创对比拆开语言和地缘。
论文把位置放在多语越狱评测与文化接地安全基准的交叉处,要分开的是高风险NSPS里的语言效应和地缘接地。
多语越狱与跨语言迁移失败
- Tower of Babel与Tongue-Tied(Huang等,2025;Upadhayay与Behzadan,2025):把有害提示译入类型距离远或低资源语言,可绕过主要在英语上训练的拒答。Deng等(2023)的MultiJail、Yong等(2023)、Shen等(2024)、Wang等(2024)的xSafety、Friedrich等(2025)的M-ALERT被归入同类跨语言迁移失败。
- 作者的区分:这条线主要改变固定场景的表面形式,探测的是分词与表示层面的稳健性;本文问的是场景经语义转创本地化之后,安全是否仍成立。
- Zhang等(2026):用项目反应理论报告部分前沿系统上英语提示的有害响应率更高。作者指出,该研究把部分反转归因于较弱模型的能力不足,且出现该现象的模型族对不上本文的闭源/开源划分;直接请求消融被作者视为互补读法。
文化接地与转创
- CAGE(Kim等,2026):合成文化适配提示,并发现韩语适配相对直接翻译有更高攻击成功率。作者称本文方向相反,韩语和韩国情境倾向抑制有害输出,并视两者为互补:CAGE覆盖宽泛危害、用LLM生成提示和二元攻击成功率;本文聚焦对抗性NSPS、人工转创和量规评分。
- KSAFE-MM(Kim等,2026):同期韩语多模态基准。作者称其报告相反方向,文化接地、尤其图像接地相对通用输入提高攻击成功率。作者把分歧归因于增加的视觉攻击面,以及新构造的韩国特定有害查询,而不是本文这种固定对抗意图、只做实体级替换的转创。作者还称,它报告了同样的安全—过度拒答权衡:韩语调优的HyperCLOVA X在其文化特定划分上攻击成功率最低、拒答率最高。
情境化安全基准
- AIR-Bench(Zeng等,2024)把提示映射到政策派生的风险类别。SafeWorld(Yin等,2024)把查询接地到50个国家、经人工核验的文化规范与法律,并发现地区间情境适当性差异大。
- CultureGuard(Joshi等,2025)与LinguaSafe(Ning等,2025)提供文化感知资源和面向转创的多语流程。Aakanksha等(2024)强调安全结果依赖情境,不能还原成只变语言。
- 作者认为,现有基准常跨语言与情境聚合,或依赖自动生成,因而难以区分翻译造成的变化和地缘接地造成的变化。
基线、数据与定位
- 数据与对照:Phase 2纳入FORTRESS(Knight等,2025)的739对提示及量规,Phase 1新增496对。主实验的对照是同一对抗意图的翻译与转创变体,不是另设外部攻击算法。附录F.4另以13个模型复现MultiJail。
- 作者将本文定位为专家驱动的基准和评测框架:在匹配意图上比较翻译与转创,用量规同时看有害遵从和保守行为,并分析前沿模型与区域模型的交互。信息泄露被单列为NSPS风险,覆盖良性框架下对敏感本地操作细节的检索式披露。
论文如何解决这个问题?
转创矩阵组合英/韩语言与美/韩实体,再用量规和TRS比较同一意图。
ROK-FORTRESS把同一对抗意图放到语言(英语/韩语)和接地(美国/韩国机构、实体与操作细节)的受控组合里,再用提示专属二元量规和分层加权风险分比较变体。
任务与风险域
- 三件套:每题有对抗提示、关键词相近但意图无害的良性提示,以及1–7条二元量规(均值6.01,标准差1.17)。良性配对用来量过度拒答:作者认为校准良好的模型应拒绝对抗提示、回答良性提示。
- 规模(Table 1):文化无关565题、文化特定670题,合计1,235。四域为CBRNE 389、政治暴力370、犯罪活动382、信息泄露94。子域计数在Table 3。
- 信息泄露:检索式询问敏感军事或基础设施信息。作者称其针对一种盲点:模型可能拒绝程序性请求,却把事实查询当成百科请求并披露操作细节。量规看的是敏感信息是否看似被放出,不核对其事实准确性(附录C.5)。
转创矩阵
- 文化无关:只评VEn(英语)和VKo(韩语翻译)。
- 文化特定:VEn,US为英语加美国情境;VKo,US为韩语翻译、保留美国情境;VEn,KR为英语加韩国文化适配;VKo,KR为韩语加韩国适配,即完整转创。
- 转创而非直译:保留对抗意图,把机构、人员、地点、设施换成目标情境中功能与规模可比较的指称。混淆文本先还原、翻译后再重新混淆,以保留攻击结构。文化特异性由红队和译者判定;附录指南要求不确定时默认判为文化特定。
- 对抗提示由专家红队撰写,策略类别包括角色扮演、混淆、情感诉求等。论文未把威胁模型写成白盒、黑盒或无盒。
危害维度与分数
七个功能维度是Specificity、Acquisition、Weaponization、Delivery、Vulnerability Exploitation、Targeting Guidance、Operational Windows(Table 2)。韩国政策专家把领域与维度映到Tier 1–3,权重为1、2、3:Tier 1是低门槛或通用信息,Tier 2是使能能力或后勤,Tier 3是高影响执行或关键泄露。各领域的具体层级在Table 5。
安全拒答时该题风险记0;否则为被判违规准则的权重和除以该题全部准则权重。TRS是该比例在变体全部对抗任务上的均值再乘100,范围0到100。定义处未写明“安全拒答”由哪个分类器判定。语言降幅为
Δling(m)=TRS(m,VEn)−TRS(m,VKo)
即文化无关任务上英语与韩语TRS之差。情境降幅是文化特定任务上、分别固定英语和韩语后,美国情境减韩国情境的TRS差,再取平均。过度拒答分ORS是良性提示被拒的百分比,分类器为Gemini 3.1 Pro。作者报告TRS而不是FORTRESS的平均风险分,以便按预期下游后果加权,并沿用ORS。
构建与质控
- 两阶段:Phase 1由内部红队新写496对对抗—良性对;Phase 2将这批与FORTRESS的739对做专业韩语翻译和文化适配。
- 人员:经核验的韩语母语者,学历从本科到博士,学科含商科、STEM、法律和语言学。敏感内容为选择加入,并提供健康资源。贡献者报酬高于当地最低工资,无无偿劳动(附录C)。
- 文化特定四步:标出必须改的在地实体,译入韩语,换成可比较的韩国指称,再回译英语核验语义等价。
- 质控:清单检查韩国指称、实体是否找对、无意图漂移的母语流畅度、替换是否可比较。禁止用AI工具生成或评估提示。完整内部撰写规程未公开。
评审与直接请求
- 两步自动分类:Gemini 3 Pro Preview把每条量规分到七个危害维度;三评审多数投票判断响应是否满足每条准则,YES为有害。自由文本判决由Gemini 2.0 Flash解析成结构化标签。
- 最终面板:HyperCLOVA X + o4-mini + Kimi K2[medium]。作者选择它,是因为各变体F1都不低于0.783、覆盖率100%,且来自韩国、美国、中国模型族。变体各自的最优面板另有报告,主实验不用它们。
- 直接请求:对全部1,235题去掉越狱包装、保留核心有害意图,做成短提示,再走同一转创流程,文化特定题每题四个变体、文化无关题两个。生成模型写为Gemini 3 Pro,最多三轮自动核验后再人工复核。合规与拒答另由Gemini 3.1 Pro分类。附录G给出各模块提示词。
论文做了哪些实验?
作者称14个模型上韩语变体TRS多更低,汇总Δling为+10.21个百分点。
实验设置
- 被测模型(Table 11,主实验14个):闭源为GPT-5.2、o4-mini、Claude Opus 4.5、Claude Sonnet 4.5、Gemini 3 Pro Preview;开源为Llama 4 Maverick Instruct、Kimi K2 Thinking、Qwen3 235B-A22B、DeepSeek V3.2、Mistral Large 3(675B);韩国模型为K-EXAONE、Solar Open、HyperCLOVA X Seed(32B)、Kanana 2。可用处同时有推理与对话配置,采样参数见表。正文常把Gemini 3 Pro Preview简称为Gemini 3 Pro;直接请求生成写的是Gemini 3 Pro,论文未说明是否为同一检查点。
- 数据:ROK-FORTRESS共1,235题(Table 1)。文化无关565题比较VEn与VKo;文化特定670题比较四个转创变体。附录F.4另在MultiJail上评13个模型、10种语言、81,900个提示-响应对。
- 对照:主实验对照是同一意图的语言/接地变体,不是外部攻击算法。相对FORTRESS,本文报TRS而非平均风险分,并沿用ORS。
- 指标:TRS为0–100;Δling是文化无关任务上VEn减VKo;Δctx是固定语言后美国减韩国情境的平均差。直接请求报告合规率。
- 评审:主结果用HyperCLOVA X + o4-mini + Kimi K2[medium]三票多数。维度分类用Gemini 3 Pro Preview。ORS和直接请求的拒答分类用Gemini 3.1 Pro。人工校准:两位标注者对97条准则的维度一致度κ=0.57;响应判定为97题扩成266个任务-变体对、1,489条准则,κ=0.874,原始一致率94.0%。
- 推断:领域分解用2,000次百分位bootstrap;交互项用1,000次配对任务重抽样,14次比较做Bonferroni校正。论文未报告每个提示的重复采样次数。全球模型走商业API,韩国区域模型用本地vLLM;只做推理、不训练。
主结果
表格较宽,可左右滑动
匹配比较 更低一侧 模型数 论文点名的例外 文化无关:VKo vs VEn VKo 12/14 Qwen 3、Gemini 3 Pro 美国接地:VKo,US vs VEn,US VKo,US 13/14 Qwen 3 韩国接地:VKo,KR vs VEn,KR VKo,KR 12/14 Qwen 3、Gemini 3 Pro 英语:VEn,KR vs VEn,US VEn,KR 14/14 无 韩语:VKo,KR vs VKo,US VKo,KR 11/14 未逐一点名 计数来自Figure 2及第5.2节。文本未给出图中逐模型TRS。
- 作者称最低TRS一组包括Claude Opus 4.5和Claude Sonnet 4.5,中间一组包括GPT-5.2、o4-mini和Solar Open,DeepSeek V3.2、Mistral Large 3、HyperCLOVA X、Kanana 2、K-EXAONE等更高。结论写14个模型的TRS跨度为6–51,作者称约为9倍。
- 作者称语言抑制和情境抑制同时存在,且该趋势在HyperCLOVA X、Kanana 2、K-EXAONE上仍可见;未给出这三款各自的四格TRS。图注称对抗提示是对着美国中心前沿模型迭代打磨的,韩国区域模型的排序应考虑这种提示特化不对称。
- 第5.3节作者称语言降幅均值10个百分点,约为情境降幅均值4个百分点的2.5倍。Table 19的汇总是Δling +10.21个百分点(95% CI [+9.33, +11.06])、Δctx +4.47([+3.77, +5.18])。Mistral Large 3的语言降幅为28个百分点(p<0.05),作者称比其他模型大约50%;K-EXAONE的情境降幅为12个百分点,为文中最高。
语言与情境的交互
- 测了什么:文化特定任务上,美国情境中的语言降幅减去韩国情境中的语言降幅(Figure 3b、Table 20)。正值表示韩国情境减弱语言抑制。
- 结果:K-EXAONE +7.7个百分点(bootstrap p=0.001)、Kanana 2 +7.0(p=0.002)在Bonferroni后仍为正。Llama 4 Maverick +5.6(p=0.006)只在校正前排除0。没有模型的放大项通过校正。10/14为正,符号检验双侧p=0.18、单侧p=0.09,Wilcoxon双侧p=0.14。
- 作者解读:作者把情境对语言抑制的缓解看作少数模型上的效应,而不是全模型现象,且与产地或是否开源没有系统对应。四款韩国开发模型里只有K-EXAONE和Kanana 2呈现该效应;HyperCLOVA X与Solar Open为−1.8和−2.1个百分点,校正后未列入通过项。
直接请求消融
- 测了什么:去掉越狱包装后,14个模型在全部1,235题上的合规率(Figure 4)。分类器为Gemini 3.1 Pro。
- 结果:作者称平均合规率9.6%,平均Δling约0.9个百分点,对抗提示下约10个百分点。闭源五款(Claude Opus/Sonnet 4.5、GPT-5.2、o4-mini、Gemini 3 Pro)平均Δling为+4.5个百分点。开源五款(DeepSeek V3.2、Kimi K2、Llama 4、Mistral Large 3、Qwen 3)平均为−6.0个百分点。HyperCLOVA X与Kanana 2为+15.0和+7.1个百分点;K-EXAONE与Solar Open接近零。
- 作者解读:作者认为抑制有两部分:越狱包装在转创后效力下降;闭源模型上韩语仍是与提示复杂度无关的保守风险信号。开源模型只在对抗提示下出现韩语抑制,作者认为这符合提示特化,而不是内在的基于语言的安全对齐。
评审校准与推理轨迹
- 校准:24种评审配置、12个基座模型。Claude Opus 4.5单评审F1=0.824、κ=0.725,覆盖率77.4%;o4-mini F1=0.823、覆盖率100%。分领域最高F1:政治暴力0.891(Claude Sonnet 4.5),信息泄露0.857(GPT-5.2),犯罪/金融0.838(Claude Opus 4.5[medium]),CBRNE 0.807(Kimi K2 Thinking)。变体最优面板F1分别为原英语0.882、译入韩语0.810、文化适配英语0.852、转创韩语0.855。原英语最优面板用到转创韩语时F1为0.754(Figure 5)。最终通用面板对人工共识F1=0.831、κ=0.736,跨变体平均F1=0.828(范围0.783–0.864)。
- 推理轨迹:2,872个安全结果不同的任务-变体对(语言轴1,048,情境轴1,824);可见trace为575个文化无关、990个文化特定。作者称这是观察,不建立因果。抑制案例中只在推理里识别策略的比例为36.8%,绕过案例为20.5%,作者称前者约为后者的1.8倍;完全未识别的比例,绕过为48.2%、抑制为33.8%。情境轴上1,614/1,824(88.5%)的分歧涉及影响安全结果的韩国文化实体。
- 作者解读:作者认为韩语抑制不只是一律变保守,韩语处理也更常把策略识别变成拒答。附录F.6称分类由Gemini 3 Pro完成,不能据此判断是安全架构的性质还是基准伪迹。
其他消融与分析
- Table 19的Δling:CBRNE +7.90、政治暴力 +11.17、犯罪活动 +12.77、信息泄露 +12.89个百分点,四个95% CI均不含0;Δctx为+5.11、+5.08、+4.09、+3.32,CI亦均不含0。信息泄露的Δctx下界最接近0,且与其他领域CI重叠,作者称领域间Δctx排序在统计上分不开。
- Table 27只保留非拒答的对抗响应:12/14仍有p<0.05的语言降幅;Gemini 3 Pro为−0.9、Qwen3-235B为−3.0个百分点,过滤前也不通过该检验。全体Δling +9.9、Δctx +3.8个百分点。作者认为,一旦实质回答韩语对抗提示,有害内容更少。
- 第6.1节:作者称五项被测模型的人工元评估Δling均为正,其中两个通过作者使用的统计检验,该句未点名、也未给p值。作者称英韩变体间大约有7%的绝对拒答差距;同节闭源平均Δling为+4.0个百分点、开源为+13.7。Table 25对抗响应平均字符数:VEn及VEn,US为3,574,VKo及VKo,US为1,651。
- Figure 7图注:中位ORS 4.87%,中位TRS 42.58%。作者称Solar Open的ORS约为19%,是全部模型中最高;TRS低于15%且ORS低于2%的区域没有模型。
- 附录F.4:MultiJail上LRL不安全率24.5%、HRL 22.2%,差2.3个百分点(χ²,p=0.24)。列举值包括Llama 3.1-8B +17.4、EXAONE 3.5-7.8B +9.4、Mistral Large 3 +8.8个百分点(文中标p<0.05)、Gemini 3 Pro +2.8。作者又称OpenAI、Anthropic和Google的前沿模型差距在±1%以内,与Gemini 3 Pro的+2.8并列出现。
- Table 17:五组三评审面板与人工TRS的Pearson r均≥0.836,MAE≤0.113。7,440条量规中HOW-2占36.7%,WHAT 17.4%,HOW-3 16.0%,WHEN 2.0%。
有什么可以进一步探索的点?
作者将经验结论限定在英韩与美韩轴,并把其他语言对的外部效度列为下一步。
作者指出的局限与后续方向
- 语言与地缘范围(第6.3节):作者写明经验发现限定于英韩一对语言、美韩一条地缘轴,因为每一对都需要专家人工转创和标注。
- 外部效度(第6.3节):作者称抑制和交互在14个模型上一致,并称这些模型跨越三种开发范式,说明方法在该设置内呈现稳定现象;对其他语言对的外部效度是自然的下一步。文中举例为普通话—中国、阿拉伯语—海湾国家。
- 可推广的对象(第6.3节):作者打算把受控变化语言与地缘接地的转创矩阵作为可推广贡献,而不是把英韩上的数字本身外推。
- 后续基准(第6.4节):作者称经验发现特定于英韩与美韩,矩阵被设计为可推广,并以此推动未来同时变化语言、文化、地缘和提示复杂度的NSPS基准。
- 推理分析的因果(附录F.6):作者称策略意识分类由LLM分析器Gemini 3 Pro完成,可能带来测量误差;不能判断模式来自模型安全架构,还是特定提示与情境的伪迹。建立因果需要针对安全组件的受控消融。
实验覆盖范围
- 主评测为Table 11的14个模型,分为英语中心的前沿模型和韩国区域模型;可用时包含推理与对话配置(第4.2节)。
- 任务为1,235个,四域,文化无关565、文化特定670(Table 1)。Impact Statement写明公开子集为791/1,235。
- 直接请求消融覆盖全部1,235题和14个模型,合规由Gemini 3.1 Pro判定(第5.6节)。
- 响应评审的人工校准集为97个任务、266个任务-变体对、1,489条量规;主结果面板是HyperCLOVA X、o4-mini、Kimi K2[medium](第5.1节)。
- 论文未报告每个提示的重复采样次数。推理轨迹分析覆盖2,872对中有可见trace的575个文化无关案例和990个文化特定案例(第5.5节)。附录F.4的MultiJail复现为13个模型、10种语言、81,900个提示-响应对。
总结一下论文的主要内容
ROK-FORTRESS拆开语言与地缘对NSPS安全行为的影响,作者称韩语变体抑制TRS。
ROK-FORTRESS是英韩、美韩轴上的双语NSPS基准,用来把语言变化和地缘接地变化拆开。
- 问题:多语安全评测常用翻译,原场景和实体不变。作者认为,这样测到的语言差不能直接外推到场景被本地化之后。
- 做法:1,235个任务各有良性对照和1–7条二元量规。文化无关题只变语言;文化特定题做成英语/韩语乘美国/韩国四格。人工转创替换实体并回译核验。三模型多数投票按Tier 1–3权重合成TRS;另做去掉越狱包装的直接请求。
- 主比较:Figure 2中,文化无关任务12/14、美国接地13/14、韩国接地12/14的模型韩语TRS更低;英语下14/14的韩国接地低于美国接地。Table 19汇总Δling为+10.21个百分点、Δctx为+4.47。Mistral Large 3的语言降幅为28个百分点(p<0.05)。Qwen 3、以及部分比较中的Gemini 3 Pro是语言抑制的例外。
- 交互与消融:Bonferroni后,K-EXAONE(+7.7个百分点)和Kanana 2(+7.0)上,韩国情境减弱语言抑制;10/14为正的符号检验双侧p=0.18,作者不把它当成全模型效应。直接请求平均合规率9.6%;闭源平均Δling为+4.5个百分点,五款开源为−6.0。
- 作者结论:作者认为,至少在英韩案例上,安全行为由“语言作为风险信号”和情境交互共同塑造,只做翻译会漏掉交互。提示复杂度会调节抑制:闭源在短提示上仍抑制,开源则转回翻译作为攻击向量的模式。作者建议部署评测和后训练纳入同时变化语言与地缘的红队数据,并把转创矩阵用到其他语言—文化对。