跳到正文
原文
韩国 AI 安全研究所·原文 · 入选 精选关注度74

韩国 AISI 与 Scale AI 发布 ROK-FORTRESS 多语言安全基准

언어만의 문제가 아니다, ROK-FORTRESS가 보여주는 다국어 AI 안전의 과제

AI 导读

韩国人工智能安全研究所(Korea AISI)与 Scale AI 联合发布多语言安全基准 ROK-FORTRESS,基于 Scale AI 的 FORTRESS 构建,用受控的跨语言改写矩阵把提示词语言与地缘语境分开调整,每个对抗提示词最多评估 4 种变体。数据集覆盖 CBRNE 威胁、政治暴力与恐怖主义、犯罪与金融活动、信息泄露 4 个领域共 1235 个任务,并为每个对抗提示词配一个无害对照提示词以测量过度拒答,评分由经专家参考标签校准的 LLM-as-judge 面板按专业红队成员编写的二值评分标准完成。在 14 个模型上,韩语且韩国语境的提示词一致对应更低的危害性,英语提示词的风险分最高,危害性最高与最低的模型之间风险分相差近 9 倍。去掉角色扮演、虚构背景、情感诉求等对抗包装后,专有模型在韩语上仍略更安全,而 5 个开源前沿模型在韩语请求上反而更可能作答。

推荐理由

韩国 AISI 与 Scale AI 联合发布的 ROK-FORTRESS 把语言与地缘语境拆开测量,为多语言安全评测提供了可迁移的矩阵设计。

阅读原文aisi.re.kr