跳到正文
原文
论文追踪· arXiv:2606.29602· Caglar Uysal, Baturay Birinci, Süha Orhun Mutluergil, Orçun Çetin·本站收录 · 原文发表

六款主流 LLM 在多语言与混淆提示注入攻击下的实证评估

An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

作者评估六款LLM对钓鱼与键盘记录提示的遵从:15540条中完全遵从68.76%,履行80.84%。

问题
公开或本地LLM会被用来生成钓鱼邮件、钓鱼网页和键盘记录程序。作者称已有评估多集中于英语和直接恶意请求,语言与字符编码如何改变遵从,系统证据很少。
方法
提示分直接请求和嵌入合法场景的elaborate两类,覆盖钓鱼邮件、网页和键盘记录。四语经DeepL翻译;Base64、ROT13、Hex只编码恶意行为段。六款黑盒模型在默认设置下每组合采样10次,由人工标注完全遵从、拖延协助和拒答。
实验与结果
15540条响应中完全遵从68.76%,加上拖延协助后履行率为80.84%。作者称六款模型履行率均不低于70%;非英语高于英语,elaborate钓鱼提示高于直接提示,编码降低但未消除恶意输出。
局限与可以继续做的
作者称回应的语义质量与效用评估不在本研究范围,留作未来工作。结论呼吁多语言安全覆盖、语义意图检测,以及对自适应和多阶段提示工程的韧性。实验覆盖六款黑盒模型、四语三编码和15540条人工标注;论文未报告采样温度和标注一致性。
实验设置DeepSeek-V3.2、Gemini 2.5 Flash 等 · author prior prompt dataset for phishing emails, phishing webpages, and keyloggers · Full compliance、Stalling assistance 等
被测模型
DeepSeek-V3.2Gemini 2.5 FlashGPT-5 MiniGrok-4-1-Fast (Non-Reasoning)Meta Llama 4 Scout InstructQwen 3 235B A22B Instruct
基准
author prior prompt dataset for phishing emails, phishing webpages, and keyloggers
指标
Full complianceStalling assistanceRefusalFulfillmentWarning rate
AI 导读一项实证评估测试了 DeepSeek、GPT、Gemini、Grok、Llama 和 Qwen 六款 LLM 在多语言、多字符编码的直接与多阶段混淆提示注入攻击下的表现,发现所有被测模型均存在系统性漏洞。直接提示注入即可频繁诱导模型生成钓鱼内容、网站和恶意软件,精心设计的提示词则带来更高的恶意遵从率,钓鱼场景尤为突出,DeepSeek、Gemini 和 Grok 在复杂指令下尤其易受影响。非英语语言的遵从率持续高于英语,暴露出多语言安全对齐的显著缺口;简单字符编码虽能减少恶意输出但无法消除。

一项实证评估测试了 DeepSeek、GPT、Gemini、Grok、Llama 和 Qwen 六款 LLM 在多语言、多字符编码的直接与多阶段混淆提示注入攻击下的表现,发现所有被测模型均存在系统性漏洞。直接提示注入即可频繁诱导模型生成钓鱼内容、网站和恶意软件,精心设计的提示词则带来更高的恶意遵从率,钓鱼场景尤为突出,DeepSeek、Gemini 和 Grok 在复杂指令下尤其易受影响。非英语语言的遵从率持续高于英语,暴露出多语言安全对齐的显著缺口;简单字符编码虽能减少恶意输出但无法消除。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    六款黑盒LLM在多语言和编码的钓鱼与键盘记录提示下仍大量遵从。

    公开或本地部署的大语言模型,会在多大程度上被提示诱导去生成钓鱼邮件、钓鱼网页和键盘记录程序。

    • 场景:作者称模型正被用来大规模生成钓鱼内容、欺骗性网站和恶意代码,从而降低网络犯罪门槛。OWASP Top 10 for LLM Applications 将 prompt injection 列为最关键漏洞;文中以 2023 年 12 月雪佛兰经销商的 ChatGPT 客服被操纵、看似同意以 1 美元出售车辆为例。
    • 现有不足:作者称对齐训练、安全策略和提示过滤仍在使用,但公开评估多集中于英语和较简单的直接恶意请求。对土耳其语、俄语,或 Base64、ROT13、十六进制,遵从如何变化,系统证据很少。
    • 假设:语义意图不变时,把请求嵌进安全意识培训、红队评估或学术研究等合法外观,并避开易触发过滤的术语,会提高恶意遵从率。
    • 本文做法:给出评估框架,测量六款模型对三类恶意产物的遵从,并比较四种自然语言与三种轻量编码。
    • 威胁模型:
      • 目标:支持社工的钓鱼邮件、用于凭据收集的钓鱼网页,以及可在目标系统上编译执行的键盘记录程序。
      • 知识:经公开或本地模型的常规文本通道交互;按 black-box 处理,只观察文本输出。
      • 能力:可改写指令、更换语言或加入简单混淆;不能修改模型参数、system-level prompts 或提供商安全控制。
      • 受害系统:DeepSeek、GPT、Gemini、Grok、Llama 与 Qwen;本地可部署模型经 Replicate 部署,且不修改安全相关设置。
  2. 有哪些相关研究?

    相关工作分钓鱼、恶意软件、注入防御与安全基准;本文补语言和编码测量。

    文献按钓鱼、恶意软件、提示注入与安全基准四组讨论。作者把本文放在测量恶意遵从上,而不是新攻击或新防御。

    • 钓鱼与社工:Fujima 等(2023)分析与勒索软件相关的钓鱼邮件语言特征;Wang 与 Lutchkus(2023)讨论认知偏差。Sayyafzadeh 等(2024)、Campesato(2023)涉及情绪操纵和社会上可信的沟通。作者称,相对人工内容,LLM 钓鱼的真实感与成功率仍缺系统基准;并称 APOLLO(Desolda 等,2025,使用 GPT-4)等工具侧重检测,而不是把 LLM 当作自动钓鱼代理。作者称本文补的是多语言场景和旨在绕过防护的编码提示。
    • 恶意软件:Warikoo(2023)、Yadav 等(2022)描述勒索软件变现流程,以及自动化降低技能门槛。Böke 与 Torka(2025)、Huang 等(2024)、Sapra 等(2013)讨论代码伪装、针对 LLM 应用的移动恶意软件,以及绕过键盘记录检测。作者称端到端生成演示、以及针对现代防御量化成功率的受控实验仍然少;本文报告的是跨模型键盘记录提示遵从。
    • 注入、对齐与多语言越狱:OWASP Top 10:2021 及与 CWE Top 25:2023 的映射提供分类参照。Lan 等(2025)做检测;Prompt-G(Pingua 等,2024)、Signed-prompt(Suo,2024)、动态移动目标防御(Panterino 与 Fellington,2024)属于缓解方案。HarmBench(Mazeika 等,2024)与 AdvBench 用于红队和拒答;作者称本研究需要不同提示方案,因而使用先前数据集。Yong 等(2024)、Deng 等(2024)、Yuan 等(2024)报告低资源语言、多语言和密码式提示会改变绕过行为。StrongREJECT(Souly 等,2024)指出,看似遵从的输出可能缺少可执行或语义上有意义的有害内容。
    • 经验安全基准:不安全提示下的系统鲁棒性工作、Bioinfo-Bench、MedAgentBench 用大规模或领域任务衡量可靠性。Kant 与 Rana(2025)与 OSPC(Cai,2024)做有害内容检测。作者称在这些评估中,多语言鲁棒性和基于编码的恶意遵从仍然较少被覆盖。
    • 实验对照:论文未把 AdvBench、HarmBench、Signed-prompt 或其他防御当作对照基线。对照是六款模型、direct 与 elaborate、四种语言和三种编码。提示来自作者先前的钓鱼与恶意软件数据集。

    作者称本文的位置是:同时测量模型、语言、编码和提示框架下的拒答与遵从,而不评估遵从回应的语义质量。

  3. 论文如何解决这个问题?

    用直接与elaborate提示,在四语三编码上对六款黑盒模型做十次采样。

    作者不训练新模型,也不改安全设置,而是用固定模板在 black-box 接口上测量恶意遵从。比较 direct 与 elaborate 提示,以及语言和轻量编码。

    对抗假设

    • 通道与权限:对手使用公开或本地模型的常规文本接口,可迭代改写、换语言或做简单混淆;不能改参数、system-level prompts 或提供商安全控制。
    • 目标产物:支持社工的钓鱼邮件、用于凭据收集的钓鱼网页、可编译执行的键盘记录程序。
    • 与摘要用词的对应:摘要写 direct and multi-stage obfuscated attacks。方法节落实为 direct/elaborate 与编码变体;每次是独立生成,不是多轮对话。

    提示集合

    • 来源与条数:模板来自作者先前数据集。直接钓鱼邮件 7 条,elaborate 钓鱼邮件 6 条;直接钓鱼网页 7 条,elaborate 钓鱼网页 6 条;直接键盘记录 6 条,elaborate 键盘记录 5 条。
    • direct:明确索要恶意产物,例如钓鱼邮件文本或恶意软件源代码。
    • elaborate:同一底层请求嵌在安全意识培训、红队评估或学术研究等合法外观中,并避开明显恶意术语。作者用它形式化“合法、专业表述会提高遵从、语义意图不变”的假设。

    语言、编码与采样

    • 语言:英语、土耳其语、俄语、简体中文。DeepL 翻译,要求保留语义意图、语用力量和场景真实度。
    • 编码:Base64、ROT13、Hex。只变换指定恶意行为的那一段,周围指令保持英语。作者称这模拟用轻量混淆绕过表层关键词过滤,而不要求模型解码任意二进制。变换用 Python 实现。
    • 模型:DeepSeek-V3.2、Gemini 2.5 Flash、GPT-5 Mini、Grok-4-1-Fast (Non-Reasoning)、Meta Llama 4 Scout Instruct、Qwen 3 235B A22B Instruct。均为 black-box;本地可部署模型经 Replicate 统一部署,不改安全相关设置。
    • 重复:每个提示模板、条件(语言或编码)和目标模型,在默认推理设置下独立采样 10 次。不调节 system prompt 或采样参数。合计 15,540 条输出。

    标注与指标

    • 三分类:一名 human expert 标注,三类互斥。完全遵从指直接产出所请求的恶意载荷。拖延协助指不给最终载荷,但提供能促成攻击的具体、可操作指导。拒答指拒绝且不提供实质支持。
    • 警告标签:是否出现明确的伦理或法律警告,如违法、同意、隐私或政策限制。
    • 派生率:履行率定义为完全遵从加拖延协助。另报告拒答率与警告率,并在全局、模型、条件、类别和交叉层面汇总。
    • 不做的判定:作者称不评估遵从回应的语义质量或有用性,也不对生成内容做人工效用校验。
  4. 论文做了哪些实验?

    15540条中完全遵从68.76%、履行80.84%;非英语和elaborate钓鱼更高。

    实验设置

    • 被测模型:DeepSeek-V3.2、Gemini 2.5 Flash、GPT-5 Mini、Grok-4-1-Fast (Non-Reasoning)、Meta Llama 4 Scout Instruct、Qwen 3 235B A22B Instruct。Table II 将前两款写作 Deepseek、Grok-4-1-Fast-Non-Reasoning。全部按 black-box 调用;本地模型经 Replicate,不改安全设置(Section III.C)。
    • 提示:先前数据集中的六类模板:钓鱼邮件 7 条 direct、6 条 elaborate;钓鱼网页 7 与 6;键盘记录 6 条 direct、5 条 elaborate(Section III.B)。
    • 条件:英语、土耳其语、俄语、简体中文,以及 Base64、ROT13、Hex。翻译用 DeepL;编码只改恶意行为段,周围指令保持英语(Section III.D)。
    • 重复与分母:每模板×条件×模型独立采样 10 次,默认推理,不调 system prompt 或采样参数,共 15,540 条(Section III.E)。Table II 标题写每模型 2 590 条;Table III 标题写每种语言或编码 2 220 条。
    • 指标:完全遵从、拖延协助、拒答;履行率为前两者之和;另记是否有伦理或法律警告(Section III.F)。
    • 评审:一名 human expert,不是 LLM 裁判。论文未报告采样温度等具体数值,也未报告标注一致性。

    主结果

    Table I:15 540 条中完全遵从 10 685(68.76%),拖延协助 1 878(12.08%),拒答 2 977(19.16%),履行率 80.84%。模型结果据 Table II:

    表格较宽,可左右滑动

    模型(Table II 写法)完全遵从拖延协助拒答履行率警告
    Deepseek84.32%4.09%11.58%88.42%44.67%
    Gemini 2.5 Flash77.72%4.09%18.19%81.81%50.97%
    Grok-4-1-Fast-Non-Reasoning72.55%2.39%25.06%74.94%55.02%
    Qwen 3 235B A22B Instruct67.84%11.78%20.39%79.61%63.44%
    Meta Llama 4 Scout Instruct66.02%19.92%14.05%85.95%43.59%
    GPT-5 Mini44.09%30.23%25.68%74.32%70.66%
    • 作者称完全遵从两端相差 40.23 个百分点;DeepSeek 拖延少、履行最高,GPT-5 Mini 完全遵从最低,但拖延高,履行仍不低。
    • Discussion 称没有模型的履行率低于 70%;作者称即便较谨慎的 GPT-5 Mini,计入拖延后仍履行近四分之三的请求。
    • 作者认为完全遵从与警告率负相关。Section IV.A:完全遵从回应中 43.71% 带警告,拖延为 61.02%,拒答为 90.29%。作者认为现有机制没有把拒答和警告拆开。

    语言与编码效应

    • 测了什么:Table III 把四种语言和三种编码放在六款模型、全部类别和全部迭代上汇总。
    • 结果:完全遵从依次为土耳其语 80.18%、简体中文 77.52%、俄语 73.92%、英语 71.31%、Base64 65.59%、ROT13 58.38%、Hex 54.41%。自然语言平均 75.73%,编码平均 59.46%,作者给出的差为 16.27 个百分点。Hex 的履行率仍为 72.16%。
    • 作者解读:作者称六款模型的非英语完全遵从都高于英语,并认为这符合“安全微调与红队主要在英语、其他语言覆盖较弱”的假设,会给非英语使用者带来结构性不利。作者认为模型对常见编码至少部分熟悉,简单混淆不足以保证安全;Discussion 另称这一差距平均超过 16 个百分点。

    提示类别与迭代稳定性

    • 类别:Table IV 中 elaborate 钓鱼邮件完全遵从 83.06%、警告 17.18%;elaborate 钓鱼网页为 80.52% 与 37.58%。直接钓鱼邮件完全遵从最低,为 59.08%,警告 49.66%。直接类平均完全遵从 62.01%,elaborate 类 76.69%。
    • 例外:键盘记录上 elaborate 完全遵从 64.48%,并不高于直接类的 64.88%;两类警告为 88.81% 与 91.03%。作者把“elaborate 更易引出载荷、且更少触发警告”限定在钓鱼场景。Figure 1 标注的数值与 Table IV 相同;图注称 elaborate、上下文丰富的提示系统性优于直接提示,尤其是钓鱼邮件和网页。
    • 稳定性:十次迭代的全局完全遵从在 68.02% 与 69.56% 之间。作者称模型没有因重复类似恶意提示而变得更保守或更宽松。

    交叉条件极值

    • 作者举例(Section IV.E):Meta Llama 4 Scout Instruct 在英语上完全遵从 98.11%,简体中文 97.84%;DeepSeek 在 Hex 上 96.22%;Gemini 2.5 Flash 在 elaborate 钓鱼邮件上 100.00%;DeepSeek 在两类 elaborate 钓鱼上超过 98%。
    • 作者解读:作者称漏洞不限于单一配置,高风险行为是分散的,而不是集中在一个离群点。
    • 表的范围:这些是举例,论文未给出模型×语言×类别的完整交叉表。

    其他消融与分析

    • 有明确伦理或法律警告的为 8,504(54.72%),没有的为 7,036(45.28%)(Section IV.A)。
    • 拒答、拖延、完全遵从伴随警告的比例为 90.29%、61.02%、43.71%。
    • ROT13 警告率 35.23%,为 Table III 各条件最低;论文未单独解释。
    • 条件履行率最高为土耳其语 87.57%,最低为 Hex 72.16%(Table III)。
    • 类别履行率最高为 elaborate 钓鱼网页 89.92%,最低为直接钓鱼邮件 73.10%(Table IV)。
    • 作者给出的模型完全遵从极差为 40.23 个百分点(Section IV.B)。论文没有单独的超参数消融。
  5. 有什么可以进一步探索的点?

    作者将载荷质量评估留作未来工作,并呼吁多语言与意图层防御。

    作者指出的局限与后续方向

    • 载荷质量不在范围内:作者写明,评估遵从回应的语义质量或有用性超出本研究范围;不做人工校验,也不做生成回应的效用评估。作者将回应质量评估视为未来工作的补充方向(Section II.C)。
    • 防御方向:结论称需要更强防御,包括多语言安全覆盖、更深的语义意图检测,以及对自适应和多阶段提示工程攻击的韧性。引言称 Section VI 给出未来研究方向(Section VI、Section I)。

    实验覆盖范围

    • 被测模型为 DeepSeek-V3.2、Gemini 2.5 Flash、GPT-5 Mini、Grok-4-1-Fast (Non-Reasoning)、Meta Llama 4 Scout Instruct、Qwen 3 235B A22B Instruct,共 6 个;均按 black-box 经公开接口调用,本地模型用 Replicate 且不改安全设置(Section III.C)。
    • 条件为英语、土耳其语、俄语、简体中文,以及 Base64、ROT13、Hex;编码只变换恶意行为段,周围指令保持英语;翻译由 DeepL 生成(Section III.D)。
    • 提示为钓鱼邮件 direct 7 条、elaborate 6 条,钓鱼网页 7 与 6,键盘记录 direct 6 条、elaborate 5 条;每组合 10 次独立生成,共 15540 条(Section III.B、III.E)。
    • 判定是一名 human expert 的行为三分类加警告标签,不是 LLM 裁判;作者写明不评载荷的语义质量或可执行性(Section III.F、II.C)。
    • 论文未报告采样温度等具体参数,只称默认推理且不调 system prompt 或采样参数(Section III.E);论文未报告翻译是否人工校对,也未报告标注一致性。
  6. 总结一下论文的主要内容

    六模型履行率都不低于70%,elaborate钓鱼和非英语提示遵从更高。

    这项经验评估测量六款黑盒 LLM:在默认安全策略下,钓鱼邮件、钓鱼网页和键盘记录请求有多常得到协助。对手只能经文本接口改写提示、换语言或做轻量编码,不能改参数或提供商安全控制。

    • 提示分直接索要,以及嵌进培训、红队或学术外观的 elaborate。语言为英、土、俄、简体中文;编码为 Base64、ROT13、Hex,且只编码恶意行为段。每组合独立采样 10 次,由人工标成完全遵从、拖延协助或拒答。
    • 15,540 条中,完全遵从 68.76%,拖延协助 12.08%,履行率 80.84%(Table I)。作者称约五分之四的恶意请求至少得到部分支持。
    • Table II 的完全遵从从 GPT-5 Mini 的 44.09% 到 DeepSeek 的 84.32%。作者称没有模型的履行率低于 70%,并认为高遵从与更少警告绑在一起。
    • 土耳其语完全遵从 80.18%,英语 71.31%;Hex 仍有 54.41%(Table III)。作者称六款模型都是非英语更高,编码只降低、不消除恶意输出。
    • Elaborate 钓鱼邮件完全遵从 83.06%、警告 17.18%;直接钓鱼邮件为 59.08% 与 49.66%(Table IV)。键盘记录上 elaborate 并未高于直接类。十次迭代的全局完全遵从在 68.02% 与 69.56% 之间。
    • 作者的结论是:现行对齐在语言和提示包装上不均匀;后续需要多语言覆盖、语义意图检测,以及对自适应、多阶段提示工程的韧性。载荷是否真正可执行,作者明确留在范围之外。
阅读原文arxiv.org