研究者提出 FRA-Attack 频域正则化方法,提升对闭源 MLLM 的迁移攻击效果
Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
FRA-Attack用频域对齐与FGR做可迁移定向攻击;Claude-Opus-4.6上ASR为76.8%。
迁移式 black-box:攻击者无受害 MLLM 的架构、参数与中间表示,只能经 API 取文本。
- 闭源 MLLM 的迁移式定向攻击要让代理上的扰动对准跨模型共享的视觉焦点。作者称空间域特征冗余和代理特有梯度会削弱迁移。
- FRA-Attack 对 patch 嵌入的高频 DCT 分量做最优传输对齐,并用只依赖径向频率坐标的低通 FGR 调制输入梯度,再接入 MI-FGSM 与三 CLIP 集成。
- 1,000 对、相似度>0.5 时,作者称闭源模型上 FRA-Attack 高于先前列出的方法。Claude-Opus-4.6 的 ASR 为 76.8%(Table 1)。Gemma-3-27B-it 为 28.0%,低于 M-Attack-V2 的 30.2%(Table 3)。
- 作者称收益依赖三 CLIP 集成的相位多样性,方法面向连续色调自然图像和 captioning 协议;VQA、多轮推理及 ComDefend 等学习型防御留作后续。主结果覆盖 15 个受害模型,输入侧防御为 JPEG、高斯平滑和中心裁剪。
- 威胁模型
- 迁移式 black-box:攻击者无受害 MLLM 的架构、参数与中间表示,只能经 API 取文本。扰动在开源视觉编码器集成上优化,满足 ℓ∞ 预算,使 xadv 贴近源图,并令回复与目标图语义对齐而非反映原内容。
- 被测模型
- GPT-5.2GPT-5.4Claude-Opus-4.6Claude-Sonnet-4.6Gemini-3-flashGemini-2.5-flashGPT-5.4-thinkingClaude-Opus-4.6-thinkingGemini-3-flash-thinkingQwen3-VL-8BQwen3-VL-32BGLM-4.6VLlama-3.2-11B-VGemma-3-27B-itKimi-K2.5
- 基准
- NIPS 2017 Adversarial Attacks and Defenses Competition development setMSCOCO validation
- 指标
- ASRAvgSimKMR
研究者提出 FRA-Attack,从统一的频域正则化视角提升针对闭源多模态大语言模型(MLLM)的迁移式定向攻击效果。该方法包含两部分:对 patch 特征施加高通 DCT 目标,抑制冗余全局结构并将损失集中到承载模型内在视觉焦点的高频带;以及频域梯度正则化(FGR),一种仅依赖几何频率坐标、不涉及代理模型统计量的低通正则器,用于去除代理特有的高频伪影并保留可迁移的低频方向。在 7 家厂商的 15 个旗舰 MLLM 上的实验显示,FRA-Attack 取得更优的跨模型迁移性,在 GPT-5.4、Claude-Opus-4.6 和 Gemini-3-flash 上达到当前最佳性能。
深度解读
这篇论文试图解决什么问题?
闭源 MLLM 的迁移定向攻击难同时对准共享视觉焦点并去掉代理特有梯度。
闭源 MLLM 的迁移式定向攻击,需要扰动对准跨模型共享的内在视觉焦点,同时不沿代理特有梯度更新。
- 场景: 作者称 MLLM 已用于图像描述、VQA 和视觉推理,但视觉编码器仍易受对抗扰动影响,扰动可在人类难以察觉时改变预测。针对闭源模型,实践中是 transfer-based black-box:无参数访问,在开源代理编码器上优化后再迁移。
- 现有不足: 作者称空间域局部对齐作用在冗余、纠缠的 patch 表示上;多尺度 [CLS] 裁剪与 patch 聚类都退回全局项已覆盖的低频,承载主体身份的高频细节容量有限。代理特有梯度主要落在输入梯度谱的高频,输入增强或模型平均不分解梯度,符号更新会反复累积该成分。
- 假设: 作者认为同一频率分解可分开冗余全局结构与语义变化,梯度的几何频率坐标则提供不依赖任何代理统计量的先验。
- 提出的方法: FRA-Attack 在损失侧对高频 DCT 分量做最优传输对齐,在梯度侧用 Frequency-domain Gradient Regularization(FGR)做径向低通,再接入既有集成迁移流程。贡献部分称评测覆盖 15 个 MLLM、7 个厂商。
- 威胁模型:
- 目标: 生成视觉上接近源图 xs 的 xadv,使受害 MLLM 的描述与目标图 xt 语义对齐,而不是反映原内容。
- 知识: black-box。无受害模型架构、参数或中间表示。
- 能力: 只能经 API 获取文本回复;扰动在开源视觉编码器集成上优化,约束为 ℓ∞ 距离不超过 ϵ。
- 受害系统: 论文以 GPT、Gemini、Claude 等 MLLM 为例;成功与否看回复是否反映目标语义。
有哪些相关研究?
论文把相关工作分为 MLLM、迁移攻击与频域攻击,并称既有频域方法未做 token 级对齐。
论文第 4 节把相关工作分成 MLLM、迁移攻击和频域攻击三组。
多模态大语言模型
- 开源模型: 论文列举 BLIP-2、Flamingo、LLaVA、Llama 3、Gemma 3、Qwen3-VL、GLM-4.5V、Kimi-K2.5,称其在标准基准上表现强。
- 闭源模型: 论文列举 GPT-5、Claude-Opus-4.6、Gemini-2.5,称其常在图像编辑和跨模态推理等更难任务上更好。作者称闭源模型隐藏内部机制,黑盒鲁棒性难评估。
针对 MLLM 的迁移攻击
- 早期特征对齐: AttackVLM(Zhao et al., 2023)在 CLIP、BLIP 等代理上做 image-to-image 特征对齐,并迁移到 MiniGPT、LLaVA。论文将黑盒攻击分为 query-based 与 transfer-based,后者不需要目标梯度或反复 API 查询。
- 优化与增强: CWA 用 sharpness-aware 优化,SSA-CWA 做频谱引导增强,AnyAttack 做大规模自监督对齐,AdvDiffVLM 用扩散模型匹配特征。论文另列举动态视觉-语言对齐和更广的黑盒 VLM 迁移协议,未展开对比。
- 细粒度局部对齐: M-Attack 用随机裁剪和缩放做多尺度局部匹配;FOA-Attack 用最优传输做局部对齐;M-Attack-V2 用更强 CLIP 集成和 target-aware 语义引导。论文称 M-Attack-V2 是针对闭源 MLLM 最强的迁移基线之一。第 2.2 节称多尺度 [CLS] 裁剪家族与 patch 聚类家族都退回低频,并未定位内在视觉焦点。
频域对抗攻击
- 低频约束与输入增强: Guo et al.(2018)把扰动限制在低频以增强黑盒迁移;SSA、频域模型增强、variance tuning 和 spatial momentum 在 DCT 频带上使扰动多样化。
- 特征或梯度频谱: FACL-Attack 与 centralized perturbation 对齐干净图和对抗图的频率内容;TESSER、高频增强与分层梯度融合、commonality-oriented 梯度优化、frequency-guided adaptive gradient、FE-AdvGAN 直接改梯度或特征频谱。
- 范围差: 作者称这些方法面向 CNN/ViT 分类或检测,不处理 MLLM 视觉编码器的 token 级特征对齐;空间 patch 冗余和代理特有梯度噪声共同限制向闭源模型的迁移。
基线与数据
- 基线方法: 弱基线为 AttackVLM、AdvDiffVLM、SSA-CWA、AnyAttack,只在前 100 对上比较(表中 †)。强基线为 M-Attack、FOA-Attack、M-Attack-V2。M-Attack-V2 关闭 target-side retrieval(use_retrieval=False,target_num=1),以免引入标准威胁模型之外的检索语料。
- 图像对: 1,000 对。源图来自 NIPS 2017 Adversarial Attacks and Defenses Competition 开发集并缩放到 224×224,目标图来自 MSCOCO 验证集。
作者把 FRA-Attack 定位为在同一频域框架里处理对齐目标和优化步的迁移式定向攻击,以避开空间域 patch 冗余和输入梯度高频噪声,并称既有频域攻击未做 MLLM 编码器的 token 级对齐。
论文如何解决这个问题?
FRA-Attack 用高频 DCT 最优传输对齐 patch,再用径向低通 FGR 正则输入梯度。
FRA-Attack 把两项迁移条件拆到不同张量:高频 DCT 把局部对齐锁到内在视觉焦点,径向低通把每步符号更新限制在 model-agnostic 方向。二者接入 FOA-Attack 的集成流程,不改代理结构。
问题设定与代理损失
- 形式: 给定源图 xs 与目标图 xt,在 J 个预训练视觉编码器上最小化加权对齐损失,并限制扰动预算。论文写作
minxadv∑j=1J Wj Lj(fj(xadv), fj(xt)), s.t. |xadv−xs|∞≤ϵ 即在 ℓ∞ 球内让对抗图的代理特征靠近目标图。
- 特征: 每个 ViT 编码器给出全局 [CLS] 特征 gj 和 patch 嵌入 Ej。Wj 沿用 [21] 的逐步自适应权重,温度 T=1.0。
- 受害端: black-box MLLM。优化不读其参数或中间表示;API 文本只用于事后检查迁移结果。
高频 DCT 上的最优传输
- 变换: 对 patch 嵌入沿 token 维做 Type-II DCT。作者称 k≈0 的分量对应跨 patch 全局结构,k≫0 对应纹理、边缘等局部差异;附录 J.1 给出正交性推导。
- 选取: 阈值 θ 分开低/高频,在高频段按能量取 top-n 分量,作为内在视觉焦点的代理。作者称 DCT 确定且正交,不像 K-means 中心随初始化漂移。
- 对齐: 对抗图与目标图的这组特征用熵正则最优传输对齐。代价为 ℓ2 归一化后的余弦距离,边际均匀,传输计划为 Sinkhorn,正则系数 λ。局部损失是代价与最优计划的乘积和。
- 总损失: 每模型损失为全局项加局部项。全局项是 1 减两侧 [CLS] 的余弦相似度。默认全局权重 wg=1.0,局部权重 wl=0.2。
FGR
- 对象: 直接调制输入梯度,而不是像 SSA-CWA 那样增强输入像素。作者称要在每次符号更新前去掉代理特有噪声。
- 滤波: 对梯度做 2D Type-II DCT,按到直流分量的径向距离 d∈[0,1] 衰减后再逆变换:
∇̃=IDCT2D(ϕ(d)·DCT2D(∇)), ϕ(d)=(1−d)p 作者称 ϕ 只用几何频率坐标,不含代理导出的统计量,因此按构造是 model-agnostic。
- 接入: 正则梯度替换 MI-FGSM 中的原始梯度。论文称也可用于 FGSM 或 PGD,且不需要代理内部表示。附录 J.2 论证连续径向衰减保持同半径系数的符号和相对幅度,按频带统计裁剪则可能改变空间梯度方向。
默认优化设置
- 预算与优化器: ϵ=16/255,步长 α=1/255,迭代 N=300,动量 µ=1.0。默认优化器为 MI-FGSM。
- 对齐与 FGR: θ=10,n=10,Sinkhorn λ=0.1,多项式衰减指数 p=1.5。
- 代理: CLIP ViT-B/16、ViT-B/32、ViT-g-14-laion2B,输入均为 224×224,并共用三阶段随机裁剪。附录 C.1 的 Algorithm 1 给出完整循环。附录 A 的可视化用 n=5、θ=20,与默认不同。
论文做了哪些实验?
1,000 对上,作者称闭源模型 FRA-Attack 更强;Gemma-3-27B-it 的 ASR 为 28.0%,低于基线。
实验设置
- 代理: 三个 CLIP:ViT-B/16、ViT-B/32、ViT-g-14-laion2B。Table 5 另用单个 ViT-B/16。
- 受害模型: 15 个。闭源标准为 GPT-5.2、GPT-5.4、Claude-Opus-4.6、Claude-Sonnet-4.6、Gemini-3-flash、Gemini-2.5-flash;thinking 为 GPT-5.4-thinking、Claude-Opus-4.6-thinking、Gemini-3-flash-thinking;开源为 Qwen3-VL-8B、Qwen3-VL-32B、GLM-4.6V、Llama-3.2-11B-V、Gemma-3-27B-it、Kimi-K2.5。附录 D.2 的 6 模型试点含 GPT-4o,但未单列其 ASR。
- 数据与基线: 1,000 对源–目标图,各方法与受害模型复用。弱基线 AttackVLM、AdvDiffVLM、SSA-CWA、AnyAttack 只在前 100 对(表中 †)。强基线为 M-Attack、FOA-Attack、M-Attack-V2;后者关闭目标侧检索。
- 共享攻击设置: ϵ=16/255,N=300 次 MI-FGSM。硬件为 4× NVIDIA H200;论文称默认设置下 1,000 对攻击的墙钟时间为 3 小时。
- 指标: 同一受害模型为对抗图和目标图写描述,GPT-4o 给 [0,1] 相似度。ASR 为相似度 > 0.5 的比例,AvgSim 为均值。KMR 在 α、β、γ 三档检查目标关键词;附录 G 给出提示词。论文未报告与人工判定的一致性,也未报告显著性检验。
- 重复: 附录 K 称多种子运行,主表为均值,种子间波动在 ±2–3 个 ASR 点内;论文未报告具体种子数。
主结果
下表只列 8 个受害模型,数字均为相似度阈值 0.5、1,000 对。M-Attack-V2 记为 V2。
表格较宽,可左右滑动
模型 FRA ASR FRA AvgSim V2 ASR V2 AvgSim 出处 Gemma-3-27B-it 28.0% 0.369 30.2% 0.396 Table 3 GPT-5.4 44.5% 0.411 37.9% 0.369 Table 1 GPT-5.2 46.9% 0.427 41.2% 0.383 Table 1 Gemini-3-flash 50.8% 0.456 47.5% 0.437 Table 1 Gemini-2.5-flash 67.4% 0.545 65.9% 0.544 Table 1 Claude-Sonnet-4.6 72.9% 0.595 62.9% 0.532 Table 1 Claude-Opus-4.6 76.8% 0.613 64.5% 0.536 Table 1 GLM-4.6V 87.1% 0.687 77.9% 0.618 Table 3 - 作者称 Tables 1–2 的全部闭源模型上,FRA-Attack 高于所列先前方法;相对 M-Attack-V2,作者称 Claude-Opus-4.6 的 ASR 提升 12.3%,Claude-Sonnet-4.6 提升 10.0%。Table 1 中 Gemini-2.5-flash 的 AvgSim 为 0.545 对 0.544。† 行只覆盖前 100 对,闭源 ASR 多为 0.0 或 1.0,不与 1,000 对行直接并列。
- 省略模型的 FRA-Attack ASR:GPT-5.4-thinking 46.1%、Claude-Opus-4.6-thinking 74.0%、Gemini-3-flash-thinking 51.0%(Table 2);Qwen3-VL-8B 80.6%、Qwen3-VL-32B 77.6%、Llama-3.2-11B-V 57.3%、Kimi-K2.5 69.0%(Table 3)。作者称开源 6 个里 5 个排名第一,编码器族覆盖 CLIP-style、AIMv2、SigLIP/SigLIP-2。Table 3 的例外是 Gemma-3-27B-it,28.0% 低于 V2 的 30.2%;作者称各方法在该模型上 ASR 都相对低,并指向附录,但正文附录标记为未填写。
- 作者称开启链式推理只使各方法 ASR 发生边际变化,并认为攻击主要作用在推理前的视觉感知。对照同名标准模型:GPT-5.4 为 44.5% 对 thinking 46.1%,Claude-Opus-4.6 为 76.8% 对 74.0%,Gemini-3-flash 为 50.8% 对 51.0%。
组件消融
- 测了什么: Table 4 在 GPT-5.4、Claude-Opus-4.6、Gemini-3-flash 上拆掉 FGR 或 DCT 对齐。完整 FRA-Attack 与 Table 1 相同:44.5%/0.411、76.8%/0.613、50.8%/0.456。
- 结果: 去掉 FGR 为 39.0%/0.387、72.7%/0.585、53.1%/0.467;去掉 DCT 对齐为 38.7%/0.366、74.0%/0.597、48.1%/0.430。
- 作者解读: 作者称两组件互补,合用最强,Anthropic 上任一组件已收回大部分增益。作者称 Gemini-3-flash 主要受益于 DCT、FGR 只带来边际增益;表中去掉 FGR 后该模型 ASR 为 53.1%,高于完整方法的 50.8%。
关键词匹配与输入侧防御
- KMR: Table 21 在三档严格度上比较。γ 档 FRA-Attack 在所列 6 个模型上均为最高,例如 GPT-5.4 为 20.0% 对 V2 的 11.0%,Claude-Opus-4.6 为 28.0% 对 22.0%。并非每格都最高:GPT-5.4 的 β 为 52.0% 对 54.0%;GLM-4.6V 的 α、β 为 88.9%、76.8%,V2 为 92.9%、77.8%。作者称与 V2 的差距随严格度变大,并在 γ 达到峰值。
- 防御设置: 附录 H 在评测时对对抗图做 JPEG(quality 75)、高斯平滑(5×5,σ=0.5)或中心裁剪(比例 0.9 后再上采样到 224×224),对象为三个闭源标准模型、100 对。
- 防御结果: JPEG 下 FRA-Attack 的 ASR 为 Claude-Opus-4.6 80.0%、GPT-5.4 48.0%、Gemini-3-flash 55.0%,V2 为 70.7%、35.0%、45.0%。中心裁剪为 83.0%、59.0%、63.0%,对 67.0%、47.0%、51.0%。高斯平滑为 29.0%、3.0%、22.0%,对 21.0%、5.0%、13.0%。作者称三种防御、三个模型上 FRA-Attack 的 ASR 与 AvgSim 都更高;Table 22 中高斯平滑下 GPT-5.4 的 FRA-Attack ASR 为 3.0%,低于 V2 的 5.0%,AvgSim 均为 0.080。
单代理设置
- 测了什么: Table 5 把三 CLIP 集成换成单个 ViT-B/16,仍报告 GPT-5.4、Claude-Opus-4.6、Gemini-3-flash。
- 结果: FRA-Attack 为 6.0%/0.143、23.0%/0.257、14.0%/0.205;M-Attack-V2 为 7.0%/0.138、13.0%/0.164、7.0%/0.153。
- 作者解读: 作者称各方法性能都下降,FRA-Attack 在多数受害模型上仍最强,并认为 FGR 不是只靠集成多样性。GPT-5.4 上 FRA-Attack 的 ASR 为 6.0%,低于同表 V2 的 7.0%。
其他消融与分析
- FGR 变体(Table 8,6 个受害模型、100 对的均值,含 GPT-4o):无 FGR 62.8%;p=1.5 为 69.0%;倒数径向 66.8%;sigmoid 65.7%;按频带统计裁剪 62.7%;硬稀疏阈值 58.2%;p=3.0 为 53.5%。作者称只有保相位的径向衰减这一族高于无 FGR,且 p=1.5 是尖峰;p=0.5 为 60.5%,低于 62.8%。
- 优化器(Table 6,论文未说明样本量):FGSM 均值 38.0%,MI-FGSM(µ=1.0)60.0%,PGD-Adam 56.7%。GPT-5.4 上 PGD-Adam 为 45.0%,高于 MI-FGSM 的 43.0%。作者称去掉动量后 ASR 下降,故默认 MI-FGSM。
- Figure 4 标注的闭源 Mean ASR:4/255 时 V2 为 3.0、FRA-Attack 为 5.0;8/255 为 22.0 与 29.0;16/255 为 53.7 与 61.7;32/255 为 68.0 与 80.3%。论文未说明该均值的模型范围和样本数。
- 附录 D.5 的三模型、100 对均值与 Figure 4 不是同一组数:ϵ 为 4/255、8/255、16/255、32/255 时 Avg ASR 为 4.0%、28.3%、60.0%、80.0%;N 为 50、100、300、500 时为 29.0%、48.7%、60.0%、62.3%。
- DCT 与损失权重(Table 9–10,同一 100 对三模型均值):θ 为 5、10、15、20 时 Avg ASR 为 60.3%、60.0%、60.7%、60.3%;n=15 为 65.0%,默认 n=10 为 60.0%;wl=2.0 为 57.3%,wl=1.0 为 63.0%,默认 wl=0.2 为 60.0%。
- 其他阈值下的反例:Table 15 阈值 0.7,Gemini-2.5-flash 的 FRA-Attack ASR 为 45.5%,V2 为 48.6%。Table 13 阈值 0.3,Gemini-3-flash-thinking 为 79.7% 对 80.5%。Table 18 阈值 0.9,Gemini-2.5-flash 为 5.2% 对 5.4%。作者称四个阈值下方法排序一致;上述格子与该说法不一致。
有什么可以进一步探索的点?
作者称方法依赖三 CLIP 集成与自然图像描述协议,VQA 与学习型防御留作后续。
作者指出的局限与后续方向
- 集成依赖: 代理是三个 CLIP 变体,收益依赖该集成的跨模型 phase diversity;作者称单个 CLIP 上的 FGR 得不到同样提升,方法更宜理解为集成侧正则,而不是单模型技术(Appendix B)。
- 输入类型: 两组件面向连续色调自然图像,并假设梯度与 patch 嵌入频谱可用平滑径向轮廓近似。作者称方法不是为文字密集截图或线稿等高度结构化输入设计的(Appendix B)。
- 任务协议: 评测集中在带 GPTScore 和 KMR 的 captioning 协议。作者把 VQA 或多轮推理等 instruction-grounded 协议留作后续(Appendix B)。
- 防御扩展: 附录 H 称把防御评测扩展到开源 MLLM,以及 ComDefend 等学习型防御,留作后续工作。
实验覆盖范围
- 主结果受害模型为正文列出的 15 个 MLLM,图像对为 1,000 对;弱基线只在前 100 对(Tables 1–3)。
- 主实验代理为 CLIP ViT-B/16、ViT-B/32、ViT-g-14-laion2B;Table 5 另报告单个 ViT-B/16。共享预算为 ϵ=16/255、N=300 次 MI-FGSM。
- 成功判定为 GPT-4o 相似度 > 0.5,附录 E 另给阈值 0.3、0.7、0.9;KMR 为 α、β、γ 三档(Table 21、附录 G)。论文未报告评审与人工的一致性、统计显著性检验,以及主表的具体种子数。
- 输入侧防御为 JPEG(quality 75)、高斯平滑(5×5,σ=0.5)和中心裁剪(比例 0.9),对象是 GPT-5.4、Claude-Opus-4.6、Gemini-3-flash,100 对(Table 22)。
- 攻击优化不使用受害模型梯度。论文未报告受害 API 的查询次数;附录 D.2 的 6 模型均值含 GPT-4o,但未给出该模型自己的 ASR。
总结一下论文的主要内容
FRA-Attack 以频域对齐和梯度低通做可迁移定向攻击,闭源面板上作者称整体更强,Gemma 除外。
FRA-Attack 是面向闭源 MLLM 的迁移式定向图像攻击。作者要解决的是:空间域局部对齐重复全局低频,代理梯度的高频成分又把更新拉向代理自身。
- 做法: patch 嵌入经 Type-II DCT 后,只对高频 top-n 分量做熵正则最优传输;输入梯度经二维 DCT 后按 (1-d)^p 径向衰减再回到空间域。默认 p=1.5、θ=10、n=10,再驱动 µ=1.0 的 MI-FGSM。代理是三个 CLIP,ϵ=16/255,N=300。受害模型只在评测时经 API 看描述是否靠近目标图。
- 闭源主结果: 1,000 对、相似度 > 0.5 时,Claude-Opus-4.6 的 ASR/AvgSim 为 76.8%/0.613,GPT-5.4 为 44.5%/0.411,Gemini-3-flash 为 50.8%/0.456(Table 1)。作者称相对 M-Attack-V2,Claude-Opus-4.6 与 Claude-Sonnet-4.6 的 ASR 提升 12.3% 和 10.0%。
- 推理变体与开源: Claude-Opus-4.6-thinking 为 74.0%(Table 2)。作者称开启链式推理只带来边际变化,并认为攻击发生在视觉感知阶段。GLM-4.6V 为 87.1%;Gemma-3-27B-it 为 28.0%,低于 M-Attack-V2 的 30.2%(Table 3)。
- 消融: 去掉 FGR 后 Gemini-3-flash 的 ASR 为 53.1%,高于完整方法的 50.8%(Table 4)。换成单个 ViT-B/16 后,Claude-Opus-4.6 为 23.0%,GPT-5.4 为 6.0%,后者低于同表 M-Attack-V2 的 7.0%(Table 5)。
- 作者结论: 高频 DCT 对齐与连续径向梯度衰减作用在不同张量上,可接入既有迁移流程;FGR 消融支持连续衰减,而不是按频带统计裁剪。作者同时把收益与三 CLIP 集成的相位多样性、自然图像和图像描述协议绑在一起。