跳到正文
原文
Hugging Face Daily Papers· arXiv:2610.09920·本站收录 · 原文发表 精选关注度55

研究:多向量视觉文档索引可被反演还原页面内容

Inverting Multi-Vector Visual Document Indices

论文速读

攻击

据论文 PDF 整理(Gemini 生成),以原文为准

针对多向量视觉检索器,论文在零侧信息下重构页面,原始索引重识别top-1达98.4%且打乱顺序可被恢复。

威胁模型零侧信息(zero side information)攻击:攻击者仅掌握向量库中存储的多向量索引,无页面尺寸、来源或元数据;目标为重构原始页面图像;测试原始、层次化分词池化及随机置换打乱三种存储配置。

问题
多向量视觉文档检索器将页面编码为约千个patch向量并存放在第三方向量数据库中,论文研究在零侧信息下攻击者能否仅凭存储的向量索引重构出包含清晰文字的原始文档页面。
方法
将多向量逆向建模为条件文档图像生成,用双流MMDiT流匹配模型从向量重构页面;通过向量周期性恢复页面形状,利用无位置编码的Transformer位置模型恢复打乱向量的栅格顺序。
实验与结果
在ViDoRe v3上针对EA,原始索引逆向重构出47.4%单词与45.0%敏感token,重识别top-1达98.4%;分词池化将词召回率降至约8%;打乱顺序后位置模型将重识别top-1从3.8%恢复至93.5%。
局限与可以继续做的
作者指出攻击仅在Qwen基座的ColPali式检索器族上测试,私有编码器在研究范围之外;未评估加性噪声、量化、加密检索等防御;评测覆盖EA与EB共2个被测编码器、ViDoRe v3的8个领域共2,000页评测子集。
实验设置Tomoro-ColQwen3-8B、ColQwen3.5-4.5B 等 · ViDoRe v3、VisRAG training corpora 等 · word recall、NED 等
模型
Tomoro-ColQwen3-8BColQwen3.5-4.5BTomoro-colqwen3-embed-4bVultronRetrieverCore-Qwen3.5-4.5BwebAI-ColVec1.1-4bwebAI-ColVec1.1-8bcolpali-v1.2colpali-v1.3colqwen2-v1.0colnomic-embed-multimodal-7bcolSmol-256McolSmol-500MSauerkrautLM-ColLFM2-450M-v0.1
基准
ViDoRe v3VisRAG training corporaColPali training setvdr-multilingual-trainVDR-MEGA-2
指标
word recallNEDsensitive-token recalltop-1top-5MRRmedian rank
AI 导读和推荐理由全文 342 字

研究者提出一种针对多向量视觉文档检索索引的反演攻击,在零侧信息条件下仅凭存储的向量还原页面图像。攻击以条件流匹配反演器实现,先在 13 个公开检索器中识别出编码器,再从索引推断页面形状,并用位置模型恢复被打乱向量的顺序。在 ViDoRe v3 的 2000 页评测集上,从原始索引反演的页面恢复 47% 的单词和 45% 的敏感 token,98.4% 的情况下能把源页面排在第一;独立评判编码器下该比例为 97.7%。两种廉价防护中,token pooling 使单词召回降至约 8%,反演未成功;打乱顺序同样降至约 8%,但位置模型可将重识别率从 3.8% 提升到 93.5%。同一攻击原样迁移到另一个检索器 ColQwen3.5-4.5B 时,源页面排第一的比例为 70.2%。

推荐理由论文给出多向量视觉文档索引可被反演的具体成功率与两种廉价防护的失效边界,运营向量库的团队可据此重新评估索引的敏感级别。

深度解读

6 个问题 · 约 7,400 字

  1. 这篇论文试图解决什么问题?

    评估仅凭第三方托管的多向量索引能否在零侧信息下逆向重构成清晰文档页面。

    这篇论文试图解决的问题是:在零侧信息条件下,攻击者能否仅凭向量数据库中存储的多向量索引,完整逆向重构成包含清晰文本与排版的原始文档图像。

    • 场景与重要性:多视觉文档检索器(如 ColPali 系列)将文档页面直接按图像输入,利用视觉语言模型(VLM)编码为约 1,000 个 patch 向量(光栅顺序存储),并将索引托管在第三方向量数据库中。由于人类无法直接从向量中读出文字,该索引容易被误当作不敏感数据对待。
    • 现有防御与逆向研究的不足:文本嵌入逆向已有较多研究,但无法直接迁移到包含二维排版与图像文字的视觉文档索引;针对视觉检索压缩的层次化分词池化(token pooling)和打乱向量顺序(shuffling)等低成本处理方案,此前未被系统评估其在防御逆向攻击时的有效性。
    • 核心观察与假设:作者提出三点假设:一是索引保留了页面几何布局(每个 32×32 像素 patch 对应一个向量且按光栅顺序存放);二是每个向量由全局上下文感知的 VLM 产生,蕴含局部 patch 与全页全局信息;三是 VLM 预训练阶段已见过数千万 OCR 样本与 PDF 排版,其向量表征具备重构页面的潜能。
    • 提出的方法:论文提出了基于条件流匹配(conditional flow matching)的逆向生成框架,并结合编码器结构指纹识别、向量周期性页面形状推断,以及基于 Transformer 的向量位置恢复模型,在零侧信息下实现页面逆向。
    • 威胁模型:
      • 攻击者目标:从存储的多向量索引中重构原始文档页面图像,窃取文档内容文本、敏感 token 并实现文档重识别。
      • 攻击者知识:拥有公开模型候选池(包含目标编码器 E)以及公开文档训练数据;不知道存储索引具体由哪个编码器生成,无权访问页面尺寸、来源、元数据或任何目标库页面,即要求零侧信息(zero side information)。
      • 攻击者能力:攻击者观测到目标存储库中的全部存储向量 T(C)。论文测试了三种存储配置 T:原始序列 Tr(C)、层次化分词池化 Tp(C)(池化因子 f ∈ {3, 9}),以及随机置换打乱 Ts(C)。攻击者知晓存储配置类型 T,但不知晓具体置换排列 π。
      • 受害系统:基于视觉多向量后交互(late interaction)的文档检索系统与向量存储数据库。
  2. 有哪些相关研究?

    涵盖文本与图像特征逆向、多向量检索压缩及RAG系统隐私,定位在视觉索引逆向。

    论文涉及的相关工作主要分为以下四类:

    • 嵌入向量逆向攻击(Embedding inversion):

      • Song and Raghunathan (2020):逆向文本嵌入,恢复了句子中 50%–70% 的单词。
      • Morris et al. (2023a):针对 32-token 输入实现了 92% 的精确文本恢复。后续工作进一步放宽假设,仅需代理编码器、少量泄露对或查询访问权限(Huang et al., 2024; Chen et al., 2025; Kim et al., 2026)。
      • Kugler et al. (2024):针对上下文词向量解码为词表词汇;Morris et al. (2023b) 从语言模型下一词分布中恢复提示词。
      • Mahendran and Vedaldi (2014);Dosovitskiy and Brox (2016);Zhang et al. (2024):分别通过优化、反卷积网络和扩散先验逆向自然图像特征;Xiu and Zhang (2025) 将多模态特征解码为描述文本。作者指出,自然图像生成模型在缺乏排版规划和 OCR 监督时难以渲染清晰文字,而本文逆向器无需排版规划与 OCR 监督。
    • 多向量检索与其压缩技术(Multi-vector retrieval and compression):

      • Khattab and Zaharia (2020):提出 ColBERT 晚交互检索机制。
      • Faysse et al. (2025):提出 ColPali,将晚交互扩展到文档页面图像。
      • Clavié et al. (2024);Ma et al. (2025):提出层次化分词池化或合并策略以减少多向量检索的存储开销。作者指出,这些工作均未探究压缩后的向量还会泄露什么信息。
    • 检索增强系统的隐私问题(Privacy of RAG):

      • Zeng et al. (2024):通过操作接口提示生成模型直至其泄露检索数据库。
      • Naseh et al. (2025):基于 30 次自然查询的回答推断文档是否在数据库中(成员推理)。
      • He et al. (2025):在接口层向数据库提供商隐藏原始查询文本。作者指出,视觉晚交互存储索引本身的逆向此前未被研究。
    • 基线方法与基准:

      • 基线方法:空模型(null model,去掉条件向量的逆向生成)、kNN 基线(检索与目标索引晚交互相似度最高的公开训练集页面)以及 VAE 重构上限(原始页面经过 VAE 编解码)。
      • 使用基准:ViDoRe v3 评测基准(8 个专业领域公开子集)。
    • 本文定位:作者将文本嵌入领域已知的输入泄露风险拓展至视觉多向量检索索引,在无侧信息条件下构建了端到端的视觉文档逆向攻击流程。

  3. 论文如何解决这个问题?

    基于MMDiT流匹配,结合编码器指纹匹配、周期性形状推断与匈牙利算法重排。

    攻击框架整体基于条件流匹配(conditional flow matching)逆向器,由编码器识别、页面形状恢复、向量位置恢复和潜空间图像生成四个阶段串联而成。

    条件流匹配逆向器设计

    • 潜空间生成架构:逆向器参考 Qwen-Image 的双流多模态扩散 Transformer(MMDiT)设计,包含 16 个 block,参数量 337.1M。使用预训练冻结的 Qwen-Image VAE(空间下采样因子 8,通道数 16),在潜空间上基于 rectified-flow 路径建立流匹配模型。
    • 训练目标:以 x0 表示页面 VAE 潜变量,x1 ∼ 𝒩(0, I),t 从 logit-normal 分布采样,xt = t x0 + (1−t) x1。逆向器 vθ 仅最小化均方误差:

    L = 𝔼 |vθ(xt, t, C) − (x0 − x1)|2 作者说明不使用感知或对抗辅助损失,以避免引入额外先验而凭空生成索引中不存在的文字。

    • 有序与集合逆向器:有序逆向器(ordered inverter)为条件流分配二维旋转位置编码(2D RoPE);集合逆向器(set inverter)省略条件流位置编码,具备置换不变性,用于处理池化或无位置模型的打乱索引。
    • 无分类器引导采样:训练时以 10% 概率将条件丢弃并替换为可学习空 token。推理时采用 50 步 Euler 积分采样,引导比例设为 γ = 4。

    识别编码器(Step 0)

    • 结构测试:检查存储向量的维度、单位模长及向量数量是否符合公开处理器的输出规则,过滤候选池。
    • 参考云近邻匹配:剩余候选编码器分别对 2,000 页公开参考集 Re 编码。攻击者按平均池化向量余弦相似度检索最近参考页,并按 patch 间最大余弦重排,选取相似度最高的候选编码器。

    恢复页面形状(Step 1)

    • 原始索引的周期性分析:由于按光栅顺序排列,同列相邻行的 patch 向量相似度高。令 s(w) 表示间隔 w 的向量间平均余弦相似度,行宽 nw 估计为使 s(w) 最大的因子:

    n̂w = argmaxW ∈ 𝒲 s(W) 其中 𝒲 为 N 的因子且长宽比处于公开训练集设定的 [0.12, 8.0] 窗口内。

    • 池化索引的集合分类器:针对无明显周期的池化索引,训练两层 GELU MLP 构成的置换不变集合分类器(0.3M 参数),在约束候选形状上进行分类预测。

    恢复打乱索引的排列顺序(Step 2)

    • 位置预测模型:构建 6 层无位置编码的 Transformer 编码器(19.35M 参数),利用整页 patch 向量作为上下文,直接预测各向量归一化的行与列坐标,并由前置 token 回归长宽比。
    • 二分图匹配重排:利用匈牙利算法(Hungarian algorithm)将预测坐标与 nh × nw 网格槽位进行一对一匹配,恢复排列后的向量输入有序逆向器进行采样。
  4. 论文做了哪些实验?

    在ViDoRe v3上测试原始索引、池化与打乱防护,原始索引重识别达98.4%。

    实验设置

    • 被测编码器:主测试模型 EA 为 Tomoro-ColQwen3-8B(320维,每patch一向量);泛化测试模型 EB 为 ColQwen3.5-4.5B(320维)。
    • 数据集与规模:
      • 训练集:VisRAG 训练集、ColPali 训练集、vdr-multilingual-train 及 VDR-MEGA-2,去重后 EA 训练集共 682,818 页,EB 训练集共 346,770 页。
      • 评测集:ViDoRe v3 的 8 个公开领域共 19,252 页作为检索库,固定评测子集为每个领域均匀采样 250 页共 2,000 页(涵盖 11 种页面形状)。文本指标在其中参考词数 ≥ 20 的 1,927 页上评测。
    • 存储配置与基线:存储配置包括原始(raw)、层次化分词池化(pooled × 3、× 9)和打乱(shuffled)。对比基线包括 null model、kNN baseline 以及 VAE reconstruction 上限。
    • 评测指标:词召回率(Word rec.)、字符级编辑距离(NED)、敏感 token 召回率(Sens. rec.,基于正则识别数字、大写词、缩写)、重识别 top-1、top-5、MRR、中位数排名(med. rank)以及独立评测模型评估结果(indep.,由另一编码器跨模打分)。
    • 评审与采样方式:OCR 采用 PaddleOCR;重识别直接采用晚交互得分检索;采样固定使用单随机种子、50 步 Euler 积分、γ = 4。每个模型训练 1 次。

    主结果

    针对主测试模型 EA,在 2,000 页固定评测集(文本指标为 1,927 页)上的逆向结果见下表(据 Table 1):

    表格较宽,可左右滑动

    方法 / 存储配置索引类型Word rec. ↑NED ↓Sens. rec. ↑top-1 ↑top-5 ↑MRR ↑med. rank ↓indep. ↑
    Null model–0.0010.9580.0080.0000.0000.0018,161–
    kNN baselineraw0.2340.8580.1460.1990.4380.3207–
    Ours (Ours, raw)raw0.4740.2920.4500.9840.9950.98910.977
    Ours (Ours, pooled × 3)pooled × 30.0760.8580.0440.0110.0350.0294960.005
    Ours (Ours, pooled × 9)pooled × 90.0810.8790.0540.0050.0240.0187240.003
    Ours (w/o position model)shuffled0.0840.8420.0480.0380.1040.0762030.011
    Ours (w/ position model)shuffled0.2310.9250.2120.9350.9780.95510.877
    VAE reconstruction–0.9560.0280.9651.0001.0001.00010.996
    • 原始索引逆向表现:作者报告原始索引逆向的词召回率为 47.4%,敏感 token 召回率为 45.0%,重识别 top-1 达 98.4%(独立评测模型下达 97.7%),大幅高于 kNN 和空模型基线。
    • 池化保护效果:分词池化将词召回率降至 7.6%(× 3)和 8.1%(× 9),重识别 top-1 降至 1.1% 与 0.5%,作者称本文方法无法有效逆向池化索引。
    • 打乱保护与位置恢复:无位置模型时打乱索引的词召回率为 8.4%、top-1 为 3.8%;引入位置模型重排后,top-1 恢复至 93.5%(独立模型下 87.7%),敏感 token 召回率恢复至 21.2%,但词召回率(23.1%)与 kNN 基线持平。

    防护机制与位置模型评估

    • 测了什么:测试打乱索引下位置模型(P2)与逐向量探针(P1)及高斯噪声下的坐标恢复能力与逆向效果。
    • 结果:在 EA 上,P2 的行 MAE 为 1.82、列 MAE 为 4.49,落入 ≤ 1 槽位的比例为 0.197;P1 的行 MAE 为 4.60、列 MAE 为 7.77(据第 25 页表格)。P2 重排后词召回率达到 0.231,高于 P1 的 0.134 与随机排列的 0.021(据 Figure 16)。
    • 作者解读:位置误差会导致整行或文本块垂直位置错乱,使阅读顺序颠倒(NED 升至 0.925),但语义与敏感信息依然被大量保留。

    模型泛化性测试(针对 EB)

    • 测了什么:将攻击方法不作改动迁移至 ColQwen3.5-4.5B(EB)。
    • 结果:在推断形状下,原始索引的重识别 top-1 达到 70.2%(独立评测模型 EA 下为 60.5%),但在词召回率上仅为 7.9%,低于 kNN 基线的 22.3%(据 Table 2)。打乱索引结合位置模型后,top-1 为 11.2%(据 Table 2)。
    • 作者解读:攻击在重识别上依然可行,但内容泄露未能有效迁移;在相同数据下训练的 EA 控制逆向器词召回达 55.5%、top-1 达 98.9%,说明差异根源在编码器本身,但无法断定是输入分辨率还是向量数量造成。

    其他消融与分析

    • 编码器识别准确率:参考云测试在 13 个候选编码器的 26,000 次单页决策中保持 100% 准确(Table 4)。
    • 页面形状恢复准确率:周期性方法恢复 EA 原始索引形状准确率为 99.2%,集合分类器在 × 3 和 × 9 池化下分别达 99.1% 和 95.7%(第 6 页与 Section 6.1)。
    • 真实形状对比消融:在 EA 原始索引上,提供真实形状相比推断形状,词召回从 0.474 变为 0.476,top-1 从 0.984 变为 0.986(Table 8)。
    • 无分类器引导比例 γ:在 EA 原始索引上,γ 从 1 增至 4 时词召回从 0.305 提升至 0.475,在 4 至 8 之间进入平台期(第 26 页表格)。
    • 检索效用代价:ViDoRe v3 上 × 3 与 × 9 池化使平均 nDCG@10 分别下降 0.8% 与 2.2%(第 28 页表格)。

    负面结果与失败案例

    • 池化索引逆向失败:针对池化索引,所有逆向指标均跌落至 kNN 基线以下,未能成功逆向文档内容或实现有效重识别。
    • 错位失败:打乱索引重排后,虽然恢复出标题与列表等文字,但存在段落与整行垂直错位,导致 NED 接近上限 1.00(Figure 19)。
    • 重识别未排首位:EA 原始索引中有 32 页(1.6%)未排在首位,主要集中在工业手册(industrial)和法国财务文件(finance_fr)(Section M)。另有 17 页(0.8%)形状推断错误。
  5. 有什么可以进一步探索的点?

    编码器限于Qwen系ColPali模型,未测试私有模型与加密防御,池化逆向仍未解决。

    作者指出的局限与后续方向

    • 被测编码器族单一:被攻击的编码器均来自单一模型家族,均为基于 Qwen 主干的 ColPali 风格晚交互检索器,仅在一个模型家族上进行了测试(Section 8)。
    • 未研究私有编码器:编码器识别仅在 13 个公开编码器构建的库中评估;除了标记库外编码器外,未研究私有编码器生成的存储库,逆向此类索引超出了论文研究范围(Section 8)。
    • 实验设置偏保守:有序逆向器的验证损失在 100k 步时仍在下降且未见拟合,更大模型或更长训练可能提高泄露水平;训练超参数和组件未对特定编码器调优,可能次优(Section 8)。
    • 评测指标局限:基于 OCR 的指标以原始页面的 OCR 转录为基准,转录本身可能存在错误;敏感 token 依赖正则表达式启发式规则,未进行人类研究以确认读者是否认同其敏感性(Section 8)。
    • 难以甄别生成真伪:无法验证逆向页面的哪些部分是正确的;针对同一索引抽取多个样本并保留共有内容可能帮助区分高置信泄露与凭空生成内容,作者留待未来工作(Section 8)。
    • 池化逆向与更广防御探索:未尝试恢复池化向量的位置,池化能抵御逆向的结论仅针对本文尝试的方法(Section 8);作者提出了软位置预测、可微匹配分配、更大容量模型等未来方向(Appendix N);未评估加性噪声、量化、带密钥随机投影、加密检索及访问控制等防御(Section 8)。

    实验覆盖范围

    • 被测模型数量:实验具体测试了 2 个被攻击模型(EA: Tomoro-ColQwen3-8B 和 EB: ColQwen3.5-4.5B),编码器识别池包含 13 个公开检索模型。
    • 评测数据集与规模:评测覆盖 ViDoRe v3 基准的 8 个专业领域,固定评测子集为 2,000 页,文本指标在参考词数 ≥ 20 的 1,927 页上计算。
    • 防御与存储配置:测试了原始存储、层次化分词池化(因子 3 和 9)以及随机打乱 3 种存储配置;论文未测试加性噪声、量化、特征加密等防御。
    • 实验重复性:逆向采样使用单个随机噪声种子,模型各训练一次;论文未报告多随机种子采样的方差。
    • 人工评估:评测指标全部基于 PaddleOCR 规则转录与晚交互计算,未包含人工审查或人工一致性实验。
  6. 总结一下论文的主要内容

    揭示多视觉文档索引存在逆向风险,原始索引达98.4%重识别且打乱防护可被攻破。

    本文针对多向量视觉文档检索器的索引安全性展开研究,证明了仅凭第三方向量库中存储的多向量索引,在零侧信息下即可逆向恢复出包含清晰文字和排版的原始文档图像。

    • 核心问题与威胁:多向量视觉检索器通常将每页文档拆分为约 1,000 个 patch 向量存储于向量数据库中。由于向量不可直接阅读,常被假定为低敏感度数据;论文探索攻击者在没有任何文档元数据、页面尺寸或辅助侧信息的情况下,能否重建原始文档。
    • 核心方法设计:攻击框架包括四个环节:首先通过向量维度与公开参考集近邻匹配识别生成索引的具体公开编码器(13 类中识别率达 100%);其次利用同列相邻 patch 向量的周期相似性推断页面栅格长宽(准确率 99.2%);针对打乱顺序的索引,利用 6 层 Transformer 位置模型结合匈牙利算法重排向量;最后利用以存储索引为条件的 MMDiT 双流流匹配模型在潜空间生成页面图像。
    • 主要实验结果:
      • 在 ViDoRe v3 的 2,000 页测试集上针对 Tomoro-ColQwen3-8B,原始索引逆向重构出 47.4% 的词汇与 45.0% 的敏感 token,在 19,252 页文档库中实现 98.4% 的重识别 top-1 准确率(独立模型评分下为 97.7%)。
      • 层次化分词池化将词召回率削减至 7.6%(× 3)和 8.1%(× 9),重识别 top-1 跌至 1.1% 与 0.5%,表明本文逆向方法无法突破池化保护。
      • 打乱向量顺序使无位置模型时的词召回率降至 8.4%、top-1 降至 3.8%;但经位置模型恢复顺序后,重识别 top-1 回升至 93.5%,敏感 token 召回率恢复至 21.2%。
      • 在第二款检索器 ColQwen3.5-4.5B 上,原始索引逆向重识别 top-1 达 70.2%,但词召回率为 7.9%。
    • 作者结论与建议:作者认为打乱向量顺序不能作为可靠防御,因其重识别风险大多可被恢复;存储的多向量视觉索引存在严重的输入泄露风险,应像保护原始文档一样对其采取严格的安全防护。
阅读原文huggingface.co