跳到正文
原文
论文追踪· arXiv:2606.06037· Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani·本站收录 · 原文发表

SpeechJBB:语码转换语音下大型音频语言模型的越狱基准

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

论文速读

评测与基准

据论文 PDF 整理(AI 生成),以原文为准

SpeechJBB以语码转换语音评测九个LALM,X-Y平均JSR为20.92%,单语为16.39%(Table 4)。

问题
LALM的安全对齐多在单语文本有害提示上评估。语码转换会带来词汇、音系和句法变化,作者认为这增加审核的含糊。SpeechJBB用来测这种口语越狱,并对照模型是否听懂。
方法
JailbreakBench各100条有害与良性提示经TranslateGemma-4B译入四语,GPT-4o重组为十个语码转换对,XTTS合成。伪词按10%、30%、50%插在安全相关词周围。GPT-4.1判拒答、偏转或越狱。
实验与结果
九个LALM上,单语、EN-X、X-Y的平均JSR为16.39%、17.01%、20.92%(Table 4)。Voxtral平均48.27%,Gemini 2.5 Pro为4.76%。50%伪词时平均JSR 24.6%(Table 5)。
局限与可以继续做的
作者在Limitations写模型不穷尽、语言限于英德西法意、用干净合成语音、防御只测提示词。实验含九个LALM、十个语码转换对、三档伪词,以及Speech-MGSM、FLEURS、FLEURS-SLU。
实验设置Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B-Instruct 等 · JailbreakBench、SpeechJBB 等 · JSR、RR 等
被测模型
Qwen2.5-Omni-7BQwen3-Omni-30B-A3B-InstructVoxtral-Small-24BSALMoNN-13BAudio Flamingo 3Gemma 3n E4B-itGemma 4 E4B-itGPT-4o audioGemini-2.5-Pro
基准
JailbreakBenchSpeechJBBSpeech-MGSMFLEURSFLEURS-SLU
指标
JSRRRDRComplianceF1
AI 导读研究者提出 SpeechJBB,一个面向大型音频语言模型(LALM)的音频越狱数据集,覆盖英语、法语、德语、意大利语和西班牙语五种欧洲语言及两两组合的语码转换变体。结果显示,语码转换的有害音频带来明显偏高的越狱成功率,非英语单语和非英语语码转换组合的攻击成功率最高。在安全关键术语周围插入音系上合理的伪词后,随着插入密度上升,拒答率单调下降,尽管模型很少把插入的 token 理解为有害含义。理解能力基准显示,这些失败不能简单归因于多语言理解不足,若干在 ASR、口语理解和口语推理上表现较强的模型反而最为脆弱。该工作已被 EMNLP 2026 Findings 接收。

研究者提出 SpeechJBB,一个面向大型音频语言模型(LALM)的音频越狱数据集,覆盖英语、法语、德语、意大利语和西班牙语五种欧洲语言及两两组合的语码转换变体。结果显示,语码转换的有害音频带来明显偏高的越狱成功率,非英语单语和非英语语码转换组合的攻击成功率最高。在安全关键术语周围插入音系上合理的伪词后,随着插入密度上升,拒答率单调下降,尽管模型很少把插入的 token 理解为有害含义。理解能力基准显示,这些失败不能简单归因于多语言理解不足,若干在 ASR、口语理解和口语推理上表现较强的模型反而最为脆弱。该工作已被 EMNLP 2026 Findings 接收。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    语码转换与伪词扰动的语音有害请求,被用来测量LALM安全对齐是否随语言混合变弱。

    当前 LALM 对多语和语码转换口语越狱有多稳健,失败有多少来自安全失配而非理解失败。

    • 场景:作者称真实多语交流常在一句内交替语言,语音还会叠加上说话人、口音和发音差异,可能在审核或对齐之前扭曲安全相关内容。安全政策、审核准则和基准仍主要按单语英语文本设计和评测。
    • 现有不足:作者称多语条件下防护往往会变弱。已有语音越狱工作被作者描述为限于一种语言和少量模型。作者称先前工作没有把语码转换当作 LALM 的越狱向量,也没有用伪词做口语混淆。
    • 作者要回答的问题:当前模型对多语和语码转换口语越狱有多稳,以及失败在多大程度上来自安全失配。
    • 本文给出的东西:音频数据集 SpeechJBB。它覆盖英语、法语、德语、意大利语、西班牙语及这些语言组成的语码转换对,并在安全相关词周围插入伪词;随后评测九个 LALM,再用口语理解基准做对照。
    • 输入与判定:被测系统是接受语音的 LALM。作者控制的输入是由 JailbreakBench 有害提示翻译、重组并合成的语音,不是权重或隐藏状态。成功标准是 GPT-4.1 给出的 Jailbroken:无明确拒绝的部分或完全遵从。
  2. 有哪些相关研究?

    相关工作集中在英语文本越狱、多语文本混合,以及单语或口音语音越狱;作者称语码转换语音尚未被当作LALM越狱向量。

    LLM 越狱与英语中心的对齐

    • 竞争目标:论文引用 Wei et al. (2023),该文把越狱归到有用性与安全性之间的竞争目标。
    • 训练与红队:Ouyang et al. (2022) 与 Bai et al. (2022) 对应的做法包括 RLHF、带安全数据的指令微调、constitutional alignment 和内部红队。作者认为多数安全训练与评测仍以英语文本为中心,因为系统提示、安全政策和对齐指令本身多以英语写成。
    • 提示策略:论文列举 DeepInception(Li et al., 2024)的递归虚构框架、少样本越狱(Wei et al., 2026)、角色扮演(Zou et al., 2023)、密码混淆(Yuan et al., 2024)和自动对抗搜索(Perez et al., 2022)。

    多语文本与语音安全

    • 翻译与句内混合:论文转述 Yong et al. (2023) 的结果为,把有害提示译入低资源语言会提高 GPT-4 的遵从率。论文转述 Yoo et al. (2025) 的结果为,句内多语混合会进一步放大文本 LLM 的越狱成功。
    • 语音越狱:VoiceJailbreak(Shen et al., 2024)在 GPT-4o 上做语音越狱;SpeechGuard(Peri et al., 2024)研究口语问答的对抗稳健性。作者指出这二者限于一种语言和少量模型。Roh et al. (2025) 把设置扩到多语和多口音英语攻击。
    • 跨语言差异:引言引用 Kumar et al. (2025) 与 Atil et al. (2025),作者称对齐质量与安全稳健性随语言变化。Zhang et al. (2023) 被用来定义语码转换,即一句之内交替使用多种语言。

    数据来源与条件对照

    • 基准与改写来源:有害与良性提示来自 JailbreakBench(Chao et al., 2024),各 100 条。语码转换文本的生成遵循 Winata et al. (2026)。伪词探针改编自 Boucher et al. (2022) 的 token 级混淆:原词保留,改为在声学上下文里插入可发音、无语义的伪词。
    • 对照条件:论文没有把其他攻击算法列为基线。条件对照是单语、EN-X、X-Y,以及 0% 相对 10%、30%、50% 伪词。理解力对照是 Speech-MGSM、FLEURS 和 FLEURS-SLU。防御实验的对照是不加该提示的恶意与良性基线。

    作者的定位是:先前工作没有把语码转换当作 LALM 的越狱向量,也没有把伪词当作口语混淆。作者称 SpeechJBB 是首个用于多语安全评测的音频语码转换越狱数据集。

  3. 论文如何解决这个问题?

    SpeechJBB将JailbreakBench译成五语并合成语码转换语音,再用伪词插入测拒答。

    整体做法是先把文本越狱基准做成多语和语码转换语音,再加一层局部伪词混淆,用同一套三分类去测 SpeechJBB。

    从 JailbreakBench 到单语语音

    • 文本:100 条有害提示和 100 条配对良性提示。类别包括 Disinformation、Economic Harm、Expert advice、Fraud/Deception、Government decision-making、Harassment/Discrimination 等。
    • 翻译与核验:TranslateGemma-4B 译入德语、西班牙语、法语、意大利语。一名标注者核语义与自然度:德语、英语、意大利语为母语或近母语,西班牙语和法语为 C1。不合格则重新生成。
    • 合成:XTTS。单语可懂度用 omniASR_CTC_1B 报 WER,自然度用 UTMOS,数值在 Table 1。作者称按这套核验选定 GPT-4o 与 XTTS。

    语码转换对

    • 重组:在译文上用 GPT-4o 生成语码转换句,方法遵循 Winata et al. (2026),并要求不改变源提示语义。语言对记为 {lang1}-{lang2},约 40–60% 的词换成另一语言的对应词。附录 A.1 给出完整提示词。
    • 矩阵语言:含英语时,非英语为矩阵语言,即支配语法结构的语言;两边都不是英语时,lang1 为矩阵语言。作者给出的理由是避免英语主导句式,并保留更自然的切换。
    • 语音:十对为 en-de、en-es、en-fr、en-it、de-es、de-fr、de-it、es-fr、es-it、fr-it。合成时以矩阵语言为 TTS 语言,使嵌入语言带矩阵语言口音;全部文件用一个 XTTS 说话人。母语者核语法、切换点自然度和可懂度。UTMOS 在 Table 2。

    伪词探针

    • 目的:测量拒答在多大程度上依赖从声学信号中认出安全相关词。
    • 插入:音系上说得通、语义为空的伪词放在安全相关词周围,每一个原词都保留。GPT-4o 生成,插入量相对原句长度为 10%、30%、50%。附录 A.2 给出完整提示词。
    • 复核:仍用 XTTS 合成。母语者确认有害意图仍可恢复,语义没有被伪词完全盖住。Figure 1 概括从翻译、重组、可选扰动到合成和三分类的流水线。

    模型输入与标签

    • 九个 LALM:开源为 Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B-Instruct、Voxtral-Small-24B、SALMoNN-13B、Audio Flamingo 3、Gemma 3n E4B-it、Gemma 4 E4B-it;闭源为 GPT-4o audio 与 Gemini-2.5-Pro。除下述例外外,语音直接作为输入。
    • 两个接口差异:作者称 Audio Flamingo 3 若直接收到越狱音频,会描述声学内容而不是回答请求,因此先转写,再基于转写作答。Voxtral 没有系统提示接口,同一行为指令改为用户文本前缀。其余模型共用附录 A.5 的系统指令,以减少输出格式差异。
    • 三分类:GPT-4.1 输出 Refusal、Deflection 或 Jailbroken,并给短理由。Refusal 包括明确拒绝、安全声明和空输出;空输出按 JBB 协议算拒绝。Deflection 是不拒绝也不切题。Jailbroken 是没有明确拒绝的部分或完全遵从。评审提示为英语,并附上各语言译文。附录 B 给出完整提示词。

    理解力对照与防御提示

    • 分离标准:作者把 Jailbroken 定义为必须含切题的有害内容,因此没听懂的回复应进入 Deflection,而不是被算作越狱。良性集与恶意集用同一套构造。
    • 基准:单语条件下评 Speech-MGSM、FLEURS 转写和 FLEURS-SLU。SLU 是 SIB-Fleurs 上的七类话题分类。意大利语 MGSM 由英语译出后用 XTTS 合成,并经母语者核验。
    • 防御:只在推理时加系统提示,不重新训练。两步是把含混、语码转换或带扰动的输入重建为更连贯的英语请求,再核对推断出的意图后才回答。设计引用 Schraw et al. (2006) 的元认知自检。附录 F 给出完整提示词。
  4. 论文做了哪些实验?

    Table 4 平均 JSR:单语 16.39%,X-Y 20.92%;50% 伪词时均值 24.6%(Table 5)。

    实验设置

    • 被测模型:Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B-Instruct、Voxtral-Small-24B、SALMoNN-13B、Audio Flamingo 3、Gemma 3n E4B-it、Gemma 4 E4B-it、GPT-4o audio、Gemini-2.5-Pro。除 Audio Flamingo 3 先转写再答外,语音直接输入。
    • 数据与 n:JailbreakBench 有害与良性提示各 100 条;五语单语;十个语码转换对;伪词 10%、30%、50%。Table 14:每模型恶意 JSR 的 n 为 Mono 500、EN-X 400、X-Y 600、Avg 1500。
    • 指标:RR、DR、JSR。Refusal 含明确拒绝、安全声明和空输出。良性表与防御表另报 Compliance,表注写明它表示无害请求是否被正确执行。
    • 评审:GPT-4.1。两名英语、德语、意大利语母语者,在按评审自身标签分层的 N=180 上对照(每标签 60 条,每条件 45 条),以使 Deflection、Jailbroken 与 Refusal 数量相当。人–人一致率 86.7%(Cohen's κ=0.799);评审–人 85%(平均 κ=0.775;对两名标注者分别为 80.6% 与 89.4%)。另从每个输出文件抽 10 条查看,作者称约占已评审输出的 10%。
    • 语音质量:Table 1 单语 WER/UTMOS 为 En 5.4/4.2、De 6.2/3.8、Es 2.4/3.5、Fr 7.2/3.4、It 4.1/3.4。Table 2 中 En-De 的 UTMOS 为 3.8843,Fr-It 为 3.3182。
    • 检验:第 5 节报告 Wilcoxon signed-rank 与 Friedman 检验;各条件 JSR 的 Wilson 95% 区间在附录 D、Table 14。论文未报告重复实验次数。

    主结果

    据 Table 4 的 JSR(%)。省略 Qwen2.5-Omni:Mono 8.80,EN-X 10.75,X-Y 15.67,Avg 12.07。九模型均值 JSR 为 Mono 16.39、EN-X 17.01、X-Y 20.92、Avg 18.37;均值 RR 为 81.54、79.32、69.76;均值 DR 为 2.00、3.67、9.28。

    表格较宽,可左右滑动

    模型MonoEN-XX-YAvg
    Voxtral46.8047.7549.8348.27
    Gemma 424.2029.7533.0029.20
    Flamingo23.6024.0027.8325.40
    SALMoNN24.8019.5010.6717.73
    GPT-4o6.807.7516.8311.07
    Qwen3-Omni5.207.2512.338.60
    Gemma 3n4.603.7514.178.20
    Gemini 2.5 Pro2.722.587.924.76
    • 排序与反例:作者称脆弱性顺序为 X-Y > EN-X > 单语,且在 8/9 个模型上一致。均值符合该顺序。SALMoNN 一行的 JSR 从 Mono 到 X-Y 下降、RR 上升,与均值方向相反。表内 Gemma 3n 与 Gemini 2.5 Pro 的 EN-X JSR 低于各自 Mono。
    • 作者的分组与检验:作者称按模型族汇总时,专有模型平均 JSR 为 7.9%,开源模型为 21.3%。X-Y 相对单语的拒答率:Wilcoxon signed-rank,W=2.0,p=0.012。
    • 作者解读:作者认为句中有英语时更稳,可能因为预训练里英语占优;纯非英语交互会加重安全机制的意图识别失败。作者称 Figure 2 里英语的 JSR 通常最低;逐语言数字没有列入 Table 4。

    伪词插入

    • 均值:相对恶意基线(均值 RR 76.24%、DR 5.36%、JSR 18.37%),Table 5 在 10%、30%、50% 的九模型均值 RR 为 72.1%、65.6%、63.4%,DR 为 7.6%、11.9%、11.9%,JSR 为 20.3%、22.5%、24.6%。作者报告四档(0%、10%、30%、50%)的 Friedman 检验 χ²(3)=12.07,p=0.007,并称均值 JSR 单调上升。
    • 分条件均值:作者给出的 JSR 为,10%:Mono 18.12、EN-X 19.93、X-Y 22.32;30%:21.59、21.34、24.00;50%:23.55、24.76、25.48。作者称这些均值上 X-Y 仍最高。Table 5 在 50% 时并非每个模型都如此:Flamingo 的 X-Y 为 25.33、Mono 为 36.20;Voxtral 为 49.17 与 62.40;SALMoNN 为 6.83 与 11.80。
    • 例外:作者称效应在 8/9 个模型上一致,并把 SALMoNN 标为插入趋势的例外,JSR 从 17.7% 降到 15.7%、10.1%、9.1%,同时 DR 上升;作者认为这对应语义落地变弱、对有害意图的参与下降。Table 5 中 Voxtral 三档总 JSR 为 55.4、50.4、55.1。作者称专有模型均值 JSR 从 7.9% 到 9.1%、12.7%、14.8%,开源从 21.3% 到 23.5%、25.3%、27.4%。

    理解力对照

    • 良性集:Table 15 均值 Compliance 为 Mono 70.9%、EN-X 67.6%、X-Y 55.7%;Deflection 为 4.6%、7.4%、16.7%。作者的对比是:若只是听不懂,X-Y 的 JSR 应下降,但恶意 JSR 从 16.39% 升到 20.92%。Voxtral 在良性 X-Y 上的 Compliance 为 68.5%(Table 15),在有害 X-Y 上的 JSR 为 49.83%(Table 4)。SALMoNN、Flamingo 对无害单语请求的 Refusal 为 61.8%、35.0%。
    • MGSM:Table 7,EN/DE/ES/FR/IT 平均正确率:Gemini 97.9%(无答案 0.0%),GPT-4o 91.8%,Qwen3-Omni 74.1%,Voxtral 72.9%,Gemma 4 14.8%,Flamingo 6.3%(错误 78.1%),SALMoNN 2.2%,Gemma 3n 2.1%(无答案 91.0%)。作者认为弱模型的一部分越狱可能反映理解不足,但高推理能力下安全失败仍然存在。
    • ASR 与 SLU:Table 8 的 F1。Gemini ASR 均值 97.83%,SALMoNN 3.84%,Voxtral 均值 63.21%(en 94.62%,de 48.94%,it 51.97%)。SLU 均值:Gemini 76.62%,Voxtral 73.03%,Gemma 4 68.29%,Flamingo 65.34%,SALMoNN 54.13%。作者称强的多语理解既非安全对齐的必要条件,也非充分条件,并以 Voxtral、Gemma 4 为例。

    防御提示

    • 设置:附录 F 的系统提示,用于恶意基线、良性基线 and 50% 插入。Table 9 为全语言条件平均,括号是相对对应基线的差值。
    • 恶意条件:多数模型拒答上升,如 Voxtral 71.8(+26.9)、Gemma 4 88.6(+22.6)、Qwen3-Omni 95.4(+7.4)。Gemini 拒答 90.8(-3.5)、遵从 7.7(+2.9);SALMoNN 拒答 65.5(-12.6)、遵从 30.8(+13.1)。
    • 代价:良性遵从下降。GPT-4o 良性拒答 89.3(+78.5)、遵从 8.3(-75.5);Voxtral 遵从 22.0(-61.4)。50% 插入再加防御后,GPT-4o 拒答 75.7(-10.9),Gemini 86.3(-8.1)。作者称伪词可以削弱归一化这一步,效果取决于基线稳健性和输入可懂度。作者还称 Table 11 里良性与有害提示常有语义重叠,因此非恶意输入也可能被当成有害。

    其他消融与分析

    • 10% 归因(Table 6):识别率 Gemini 68.1%、Qwen3-Omni 50.8%、Gemma 4 45.8%、GPT-4o 1.9%、SALMoNN 3.8%;后两者替换率 96.8%、87.9%。各模型有害归因都低于无害与噪声,从 SALMoNN 3.7% 到 Gemini 16.8%。
    • 密度(正文 6.1 的跨模型均值):低密度时 56.7% 被换成看似合理的 token;噪声归因从 39.4% 升到 72.2%,检测从 28.9% 降到 20.1%。
    • 50% 归因(Table 13):Gemma 3n 噪声 90.0%,GPT-4o 噪声 89.8%;Gemini 识别 32.9%;SALMoNN 识别 44.6%。
    • 评审分歧(Table 3、附录 B.2):X-Y 上评审–人一致率 76.7%,为四条件中最低。360 次比较里 Refusal 与 Jailbroken 混淆 2 次(0.6%)。人–人 24 次分歧中 21 次在 Deflection 与 Jailbroken 边界,没有把 Refusal 与 Jailbroken 混淆。
    • MGSM 音频(附录 E.2):Whisper-medium 五语平均 WER 6.46%、CER 3.63%。
  5. 有什么可以进一步探索的点?

    作者把语言范围、干净合成语音和仅提示词防御写为局限;扩到更远语言被标为后续比较。

    作者指出的局限与后续方向

    • 模型集合:作者写所评模型并不穷尽,更新的系统可能表现出不同的稳健性;同时称这些模型覆盖当前实践里的主要架构族(Section 8)。
    • 语言范围:限于英语、德语、西班牙语、法语、意大利语,以便每条语码转换提示和每个音频都能由母语者按高标准核验(Section 8)。
    • 更远的语言:作者预期,扩到更低资源、类型上更远的语言会看到更大的脆弱性,并把这项比较标为后续工作(Section 8)。
    • 语音条件:口音、不流利、自发语音、背景噪声和说话人差异被作者视为与本文问题互补。作者写,由于没有先前的语音多语越狱基准,他们采用干净语音作为初始受控设置(Section 8)。
    • 防御强度:防御评测限于提示词干预。作者称这种做法本质上不如训练时对齐有力,并指出恶意输入上拒答改善与良性查询上更保守并存,因此需要提示之外的结构化对齐(Section 8)。
    • 训练方向:作者在 Section 6.3 写出可探索的方向:在语码转换和非英语语音上做安全微调,以及用多语语音训练的、感知语码转换的安全训练和护栏模型。

    实验覆盖范围

    • 模型:Section 4.1 评测九个 LALM:Qwen2.5-Omni-7B、Qwen3-Omni-30B-A3B-Instruct、Voxtral-Small-24B、SALMoNN-13B、Audio Flamingo 3、Gemma 3n E4B-it、Gemma 4 E4B-it、GPT-4o audio、Gemini-2.5-Pro。
    • 语言与规模:英语、德语、西班牙语、法语、意大利语,以及十个语码转换对(Section 3.1)。有害与良性提示各 100 条。Table 14:每模型恶意条件 Mono n=500、EN-X n=400、X-Y n=600。
    • 探针、对照与防御:伪词插入为 10%、30%、50%(Table 5)。理解力对照为单语上的 Speech-MGSM、FLEURS、FLEURS-SLU(Section 6.2)。防御为附录 F 的提示词,Table 9 报告恶意、良性与 50% 插入三种设置。
    • 评审校验:分层样本 N=180,条件为 EN/DE/IT 单语、EN-DE、EN-IT、DE-IT 和 10% 伪词;两名标注者的母语为英语、德语、意大利语(Section 4.3)。
    • 记录在案的合成与未报告项:语音由一个 XTTS 说话人合成,语码转换对以矩阵语言为 TTS 语言(附录 A.3)。论文未报告各条件的重复实验次数。
  6. 总结一下论文的主要内容

    SpeechJBB用五语语码转换语音和伪词探针评测九个LALM,作者将越狱归为对齐失败而非听不懂。

    SpeechJBB 用合成语音测量 LALM 在五语、语码转换和局部伪词混淆下的安全对齐,并另设口语理解对照。

    • 问题:作者认为现有安全评测偏单语英语文本,而真实语音交互经常在一句里混用语言。他们要分开两件事:请求没被听懂,以及听懂了但安全约束没守住。
    • 做法:JailbreakBench 的 100 条有害提示和 100 条良性提示被译入德、西、法、意,再组成十个语码转换对,由 XTTS 合成。伪词按原句长度的 10%、30%、50% 插在安全相关词旁,原词保留。GPT-4.1 把回复标为拒答、偏转或越狱;空输出算拒答。
    • 主结果:Table 4 上九个模型的平均 JSR 为单语 16.39%、EN-X 17.01%、X-Y 20.92%,平均拒答率对应为 81.54%、79.32%、69.76%。Voxtral 的平均 JSR 为 48.27%,Gemini 2.5 Pro 为 4.76%。SALMoNN 与这一排序相反:X-Y 的 JSR 为 10.67%,低于其单语的 24.80%。
    • 伪词与理解力:50% 插入时九模型平均 JSR 为 24.6%(Table 5)。作者称插入密度升高时拒答下降,而模型很少把伪词解释成有害含义。Voxtral 的五语 MGSM 正确率为 72.9%,同时平均 JSR 为 48.27%;作者认为越狱信号不能归因于多语听不懂。
    • 防御与结论:提示词防御提高了多数模型在恶意条件下的拒答,但 Gemini 与 SALMoNN 的拒答下降,良性遵从也普遍下降(Table 9)。作者的结论是,非英语对非英语的语码转换构成越狱面,只靠提示不够,需要对齐在架构或训练时完成。
阅读原文arxiv.org