跳到正文
原文
论文追踪· arXiv:2505.12287· Linghan Huang, Haolin Jin, Zhaoge Bi, Pengyue Yang, Peizhou Zhao, Taozhao Chen, Xiongfei Wu, Lei Ma, Huaming Chen·本站收录 · 原文发表

多语言越狱提示词对闭源大语言模型的攻击评估:GPT-4o、DeepSeek-R1、Gemini-1.5-Pro 与 Qwen-Max

The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models

AI 导读

一项研究用 32 种越狱攻击、中英双语六类安全内容对 GPT-4o、DeepSeek-R1、Gemini-1.5-Pro 和 Qwen-Max 发起 38,400 次测试,以攻击成功率(ASR)衡量表现。结果显示 Qwen-Max 最易被攻破,GPT-4o 防御最强;中文提示词的 ASR 始终高于英文,新提出的 Two-Sides 攻击对所有模型最有效。作者称这凸显了语言感知对齐与跨语言防御的迫切需求。

阅读原文arxiv.org