跳到正文
原文
论文追踪· arXiv:2610.05586·本站收录 · 原文发表 精选关注度33

AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

AgentDoxx: Agentic Re-identification of Anonymized Text with Web Search

论文速读

评测/基准

据论文 PDF 整理(Gemini 生成),以原文为准

作者在具已知身份的 AGENTDOXX 上评测智能体重识别,发现目标入检后超88%被识别,提示词防御难阻搜索泄露。

问题
具备搜索工具的 LLM 智能体可通过检索公开信息重识别匿名文本,但缺乏真实身份标注使得现有研究无法精确测量重识别风险覆盖度与防御的保护效果。
方法
基于 Reddit 构建含 822 位已知真实身份个体的合成访谈评测套件 AGENTDOXX,评测 15 种模型配置在 Tavily 网络搜索下的表现,并结合攻击轨迹微调模型定位关键泄露片段。
实验与结果
开源模型无搜索仍能识别 15%–28% 访谈;目标姓名入检索后超 88% 成功识别;实体遮蔽后 85.3% 样本仍被至少一个模型识别;提示词隐私防御下拒答样本中 37% 仍在轨迹中检索到了真实姓名。
局限与可以继续做的
源身份仅限网上自愿披露人群;合成访谈问题结构固定;未解耦职业与网络足迹影响;片段定位防御未在未知模型与下游任务验证;搜索实验限定于 Tavily 接口。
实验设置GPT-5.6 Terra、GPT-5 Mini 等 · AGENTDOXX、Anthropic Interviewer · Accuracy、Precision 等
模型
GPT-5.6 TerraGPT-5 MiniGPT-4.1 MiniGemini 3.7 FlashGemini 3.1 Pro PreviewDeepSeek-V4 FlashGLM-5.3 FlashKimi K3Llama-4 MaverickQwen-2.5-7B
基准
AGENTDOXXAnthropic Interviewer
指标
AccuracyPrecisionRecallAttribute Coverage Rate
AI 导读和推荐理由全文 376 字

研究者提出 AgentDoxx,一个包含 822 份合成访谈文本的评测套件,用于衡量具备联网搜索能力的 LLM Agent 对匿名文本的再识别风险。这些访谈基于 r/IAmA 中公开披露身份者的公开信息生成,经人工判别研究显示其与真实访谈难以区分。在 15 种模型配置上,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 在无搜索条件下仅凭参数知识即可正确识别 15–28% 的文本;一旦目标姓名出现在检索结果中,识别成功率超过 88%。防护方面,命名实体遮蔽后仍有至少一个攻击者能识别 85.3% 的分层样本;属性噪声替换把平均准确率从 75.1% 降至 34.2%;系统提示中的隐私指令降幅最大(75.1% 降至 21.6%),但在拒答姓名的样本中 37% 已在检索阶段拿到姓名、58% 仍描述了目标的辨识性细节。

推荐理由该研究用 822 份已知身份的合成访谈量化了联网搜索对再识别风险的贡献,并给出多种匿名化防护的实测效果。

深度解读

6 个问题,约 7,700 字。每问先给一句结论,点开看完整回答

  1. 这篇论文试图解决什么问题?

    缺乏真实身份基准使搜索增强智能体的重识别风险与防御难以测量,论文提出具已知身份的评估套件 AGENTDOXX。

    缺乏真实身份基准导致具备网络搜索工具的大语言模型智能体对匿名文本重识别的实际风险与防御保护效果无法被可靠衡量。

    • 问题场景与重要性:大语言模型(LLM)获得网络搜索等工具使用能力后,能够检索并交叉比对公开信息,使得个人隐私风险从单纯的训练数据记忆延伸至非结构化文本重识别(re-identification),即把去标识化的对话记录重新链接到具名个体。作者认为这降低了将对话披露关联到真实身份的门槛。
    • 现有研究与真实数据的局限:现有重识别研究依赖无真实身份标注的真实访谈数据集(如 Anthropic Interviewer),无法区分正确识别与看似合理的误报,难以精确测量风险覆盖率与防御有效性;同时网络搜索在重识别中的边际贡献与证据通路尚不明确。
    • 威胁模型设定:论文主要在 direct-intent 威胁模型下进行系统评测,并在动机研究中对比了 indirect-intent 设定:
      • 攻击目标:显式要求模型根据匿名访谈记录识别出受访者的具名真实身份(direct-intent),或通过多阶段流程检索受访者描述的作品间接完成去匿名化(indirect-intent)。
      • 攻击者知识与能力:攻击者拥有去标识化后的完整访谈文本;具备通过 Tavily API 进行网络搜索的工具调用能力(最多 10 次搜索,每次 15 个 URL,排除来自 Reddit r/IAmA 的结果);无访问私有数据库权限。
      • 受害系统:发布去标识化访谈文本的组织与参与访谈的真实个体。
    • 论文提出的评估套件:作者构建了包含 822 份合成访谈记录的评估套件 AGENTDOXX,受访者来自 Reddit 的 r/IAmA 且具有公开可查的真实身份,用于系统衡量 15 种模型配置的重识别能力、搜索轨迹及防御有效性。
  2. 有哪些相关研究?

    涵盖传统统计链接、LLM 属性推断与端到端重识别、以及 NER 与 LLM 改写防御,缺乏搜索增强下的系统评估。

    论文在引言与相关工作中梳理了三类研究脉络:

    经典重识别攻击

    • Sweeney (2000) 统计得出仅凭邮政编码、性别和出生日期即可唯一定位美国约 87% 的人口。
    • Narayanan & Shmatikov (2006) 以及 De Montjoye 等人 (2013, 2015) 分别展示了利用 IMDb 评分等外部辅助信息去匿名化 Netflix 电影评分数据,以及利用少量时空轨迹和交易元数据识别个人。
    • Ohm (2009) 提出匿名化保证具有时间不稳定性,随着外部辅助信息积累,原本不可识别的数据会变得可识别。作者指出这类攻击主要针对结构化或半结构化数据,需要领域特定工程和大量人工介入。

    基于 LLM 的属性推断与重识别

    • Staab 等人 (2024) 与 Yukhymenko 等人 (2024) 展示了 LLM 能从非结构化文本中推断个人属性,并在合成基准 SynthPAI 上进行了多模型评测。
    • Li (2026) 在 Anthropic Interviewer 数据集上重识别了 24 篇访谈中的 6 篇;Lermen 等人 (2026) 提出 ESRC 流水线,结合嵌入检索与推理重识别了该数据集中 33 位科学家中的 9 位,并去匿名化了平台用户。
    • Ko 等人 (2026) 形式化了推理驱动关联,指出良性分析任务中亦可涌现身份推断。作者指出先前工作未系统评估前沿模型在智能体重识别上的表现、搜索的边际影响及防御有效性。

    传统与基于 LLM 的文本匿名化防御

    • Zheng 等人 (2024)、Zhao 等人 (2024)、Baumann 等人 (2026) 与 Lin 等人 (2023) 在发布对话数据集(如 LMSYS-chat-1m、Wildchat、SWE-chat、Toxicchat)时,普遍将基于命名实体识别(NER)的标识符涂黑作为标准实践。
    • Staab 等人 (2025) 提出对抗性匿名化框架,Frikha 等人 (2025) 提出属性扰动方法 IncogniText,Yang 等人 (2025) 提出平衡效用与隐私的 RUPTA。作者指出这些防御此前仅在单机 LLM 对手下测试,未验证面对网络搜索增强攻击者时的鲁棒性。

    基准与对比基线

    • 论文以包含 1,250 篇访谈的 Anthropic Interviewer 数据集作为动机研究对象,并构建了包含 822 篇访谈的 AGENTDOXX 评估套件;对比的防御基线包括基于 Presidio(Microsoft, 2026)的 NER 实体遮蔽、NER 结合改写、属性假值替换、系统提示词隐私指令,以及微调 Qwen-2.5-7B 进行关键片段定位涂黑的方法。

    作者将本文定位为通过构建首个具已知真实身份的访谈评估套件,系统衡量智能体在网络搜索与参数化记忆下的重识别能力及防御有效性。

  3. 论文如何解决这个问题?

    基于 Reddit 构建 822 篇含真实身份的合成访谈套件,双模型审核脱敏,配合 Tavily 搜索智能体与规则匹配判定。

    作者提出了具有已知真实身份的合成访谈评估套件 AGENTDOXX,并建立了标准化搜索执行与匹配判定流程。

    数据源筛选与个人属性抽取

    1. 个体来源与链接过滤:从 Reddit 的 r/IAmA 板块获取自愿公开身份、职业背景并包含外部链接的个体;提取帖子中自我披露的 URL,保留至少包含一个可访问且含有可用属性页面的个体,最终获得 822 位真实个体。
    2. 开放式属性抽取:使用大语言模型从抓取的网页内容中抽取个人属性,结合 Reddit 帖子信息将属性关联至具体个体;属性包含具体命名实体及广泛的专业背景描述,依据与个体的相关性而非固定类别集合进行筛选。

    合成访谈生成与质量控制

    1. 结构化问题生成:所有访谈由 GPT-5.4-mini 生成。作者从 Anthropic Interviewer 数据集的 10 篇真实职场访谈样本中提炼出 8 个核心问题(涵盖日常 AI 使用、协作模式、技能维持等),8 个问题在所有访谈中通用,追问与措辞自适应调整;生成提示词严格锚定个体职业,优先保证对话真实自然而非强求属性覆盖,并要求间接呈现直接标识符。
    2. 双模型审查与人工涂黑:使用 GPT-4o 与 GPT-4.1-mini 分别独立审查职业一致性、直接标识符显式暴露和事实矛盾三项指标,取两者标记问题的并集进行人工复审;若受访者自称创始人则涂黑公司名(员工提及则保留),自称作者/导演则涂黑作品名,所有人物姓名(含合作者)在实验前均完成涂黑。

    数据集规模与结构特征

    1. 轮次与长度结构:AGENTDOXX 包含 822 篇访谈记录,每篇严格包含 8 轮对话;受访者首轮回答平均 129.9 词,后续轮次平均 96.8 词。
    2. 职业覆盖与属性分布:涵盖 183 个归一化职业类别,其中 135 个职业仅包含 1 人;人数最多的前五类职业为记者(128 人)、电影制作人(121 人)、CEO/创始人(101 人)、教授(74 人)和演员(45 人)。抽取的属性中,30.8% 在对话中显式提及,21.6% 间接传达,47.6% 未出现;首轮对话承载了 47.7% 的已呈现属性。

    智能体搜索执行与结果判定

    1. 工具调用环境:模型作为工具增强智能体运行,通过函数调用向 Tavily API 发送查询,统一限制为每篇访谈最多 10 次搜索、每次 15 个 URL、高级搜索深度;首轮调用强制要求搜索(部分开源模型因思考模式限制设为 auto),达到 10 次上限后提示模型根据已有证据作答;所有来自 Reddit r/IAmA 的搜索结果均在返回前被过滤排除。
    2. 文本归一化与相似度判定:使用 nameparser 库去除头衔与后缀,清除括号及非字母字符(保留撇号与连字符)并转小写;为每个真实姓名离线构建包含别名字典(如 Robert 对应 Bob)的表面形式接受集合;当候选名字与接受集合中任一名字的 Jaro-Winkler 相似度达到或超过阈值 0.80 时判定为正确匹配。
  4. 论文做了哪些实验?

    搜索使最强模型识别率达 48%,目标入检索超 88% 成功,实体遮蔽后仍超八成被识别,提示词防御存在轨迹泄露。

    实验设置

    • 被测模型:共 15 种配置。专有模型包括 GPT-5.6 Terra(推理设置 none 与 xhigh)、GPT-5 Mini(推理设置 high 与 minimal)、GPT-4.1 Mini、Gemini 3.7 Flash、Gemini 3.1 Pro Preview;开源权重模型包括 DeepSeek-V4 Flash、GLM-5.3 Flash、Kimi K3(均在最大推理设置下)以及 Llama-4 Maverick。其中 GPT-4.1 Mini、DeepSeek-V4 Flash、GLM-5.3 Flash 和 Kimi K3 分别测试了有搜索与无搜索(no search)对照。
    • 数据集与规模:主实验采用包含 822 篇访谈的 AGENTDOXX 全集;防御实验采用分层抽样的 143 篇访谈;动机研究包含 Anthropic Interviewer 全量 1,250 篇访谈。
    • 基线与防御条件:评估了六种去标识化条件:Base(原始输入)、NER(Presidio 遮蔽命名实体)、Spans-redacted(微调模型定位片段并涂黑)、NER+para(NER 结合改写)、Spans-para(片段定位结合改写)、Noise(属性替换为同类型假值)、Privacy(系统提示词增加隐私约束)。
    • 指标定义:准确率(Accuracy,正确识别占访谈总数的比例)、查准率(Precision,High 或 Very High 候选人中正确的比例)、查全率(Recall,正确姓名出现在候选列表中的访谈比例)。
    • 判定与评审方式:基于 nameparser 归一化与别名扩展表,Jaro-Winkler 相似度阈值设为 0.80;人类研究中 30 位独立评审员在 Prolific 上对 100 篇访谈进行真实性判断。
    • 重复次数与样本量:AGENTDOXX 主实验全量 822 篇;防御评测 143 篇;人类评估 100 篇(每篇 3 人独立评审,共 300 次判断);动机实验对候选人最多进行 4 次独立重复运行。

    主结果

    下表展示了 12 种模型配置在 143 篇分层抽样访谈上的去标识化防御实验准确率(%):

    表格较宽,可左右滑动

    模型BaseNERSpans-redactedNoisePrivacy
    Gemini 3.7 Flash97.281.155.944.150.3
    Kimi K3 Max97.285.354.556.67.0
    GLM 5.3 Flash97.279.053.851.724.5
    GPT-5.6 Terra (xhigh)95.179.050.346.20.0
    DeepSeek V4 Flash90.283.944.835.72.1
    GPT-5 Mini (high)84.668.535.739.911.2
    GPT-4.1 Mini (no search)11.25.63.55.66.3

    注:据 Table 2;受行列限制,表中省略了 Gemini 3.1 Pro Preview、GPT-5.6 Terra (none)、GPT-5 Mini (minimal)、GPT-4.1 Mini (+search)、Llama 4 Maverick 以及 NER+para、Spans-para 两列条件。

    • 作者指出 NER 实体遮蔽仅修改 0.42% 字符,各模型准确率均有下降,但在 143 篇样本中仍有 85.3% 至少被一个攻击者成功重识别(Table 2)。
    • 作者报告属性假值替换(Noise)将平均准确率从 75.1% 降至 34.2%,并在 44 篇访谈中阻断了所有攻击者;但部分具备推理能力的模型会将事实矛盾视为听录噪音而忽略(§4.3.1)。
    • 作者指出提示词隐私指令(Privacy)虽使平均准确率降至 21.6%,但属于回答层面的合规;在拒绝给出姓名的样本中,37% 已在搜索过程中检索到了受访者姓名(§4.3.2)。

    网络搜索与参数化记忆的作用机制分析

    • 测了什么:在全部 822 篇访谈上,通过无搜索消融以及按检索结果与查询词出现时序,分解 15 种配置的重识别路径(Figure 3、§4.2)。
    • 结果:无搜索消融下,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 依靠纯参数化知识分别正确识别了 27.7%、23.6% 和 15.8% 的访谈(Figure 3);五大最强配置(47.0–48.3%)中,Kimi K3 和 GLM-5.3 Flash 的确证与发现贡献相当(各占约 20–22%),而 Gemini 3.7 Flash、Gemini 3.1 Pro 和 GPT-5.6 Terra (xhigh) 则以发现为主导(占优势 3 到 5 倍);目标一旦出现在检索结果中,除 Llama-4 Maverick(80.2%)外,其余所有配置的重识别成功率均超过 88%(全配置平均 91.2%)。
    • 作者的解读:作者认为参数化知识构成了独立的隐私风险通道;网络搜索检索覆盖率(最高 53.3%)是重识别的主要瓶颈;相似的识别准确率背后存在不同的证据依赖路径。

    提示词层面的隐私合规与搜索轨迹泄露分析

    • 测了什么:在 12 种配置 × 143 篇访谈(共 1,716 对)上,评测系统提示词加入隐私限制后模型在回答与搜索轨迹层面的表现(Table 3、§4.3.2)。
    • 结果:模型在回答层面拒绝具名的 989 对样本中,58% 仍在理由中描述了受访者的职业、机构、研究领域等具体细节(Table 3),仅 42% 返回空列表;在轨迹层面,姓名在检索内容中出现的比例从 76.6% 降至 43.8%,但在回答拒绝具名的样本中仍有 37% 在搜索过程中检索到了真实姓名;GPT-5.6 Terra (xhigh) 与 Gemini 3.1 Pro Preview 输出准确率均为 0.0%,但 Gemini 在 62% 的访谈中检索到了受访者姓名,Terra 则检索到 18%。
    • 作者的解读:作者认为提示词指令仅约束了模型陈述的内容,未约束模型在推理和检索中收集组装的信息,防御在输出端有效但轨迹端存在泄露。

    基于攻击轨迹监督的关键片段定位与防御

    • 测了什么:利用 GPT-5.4-mini 分析器从 3 种开源模型的搜索轨迹与推理链中提取高风险片段,微调 Qwen-2.5-7B 定位关键信息并涂黑或改写,在 143 篇测试访谈上评估防御效果(§4.3.1)。
    • 结果:未微调的 Qwen-2.5-7B 标记了 8.22% 字符,分析器标记 4.01%,微调模型标记 2.66%;微调模型选择的字符中有 77% 与分析器重合(未微调为 20%),并召回了分析器 52% 的标记(未微调为 40%);对预测片段涂黑后,修改 2.64% 字符将平均准确率降至 35.1%(Table 2,NER 为 62.0%);结合改写后修改 0.91% 字符达到 48.4% 准确率(接近 NER+para 修改 1.50% 字符达到的 45.9%)。
    • 作者的解读:作者称基于多模型攻击轨迹蒸馏的片段定位方法,证明了攻击行为可为定向去标识化提供有效监督信号。

    其他消融与分析

    • 置信度校准过滤:对六个最强搜索配置,仅保留 High 或 Very High 候选使识别精度从 18.2–44.6% 升至 89.4–96.7%,丢弃 39.5–97.5% 候选并保留 16.7–91.7% 正确识别(§4.1)。
    • 推理计算量影响:提高推理量使 GPT-5 Mini 按姓名查询比例从 0.1% 升至 33.8%,准确率从 24.8% 升至 38.7%;GPT-5.6 Terra 准确率从 38.9% 升至 48.1%(§4.2)。
    • 职业类别差异分析:8 类主要职业中教授平均召回率最高(0.51),精度为 90%;演员平均召回率最低(0.06),精度为 48%(§C.4, Figure 5)。
    • 真实性人类评估:30 位独立评审员在 100 篇访谈上的 300 次判断中,合成与真实访谈分类准确率为 49.3%,与 50% 随机猜测基线无统计显著差异(§3.2, Table 1)。
    • 动机研究基准匹配:在 Anthropic Interviewer 的 1,250 篇访谈中,多轮验证协议确认了 43 个匹配(3.4%),其中 Science 确认率高于 Work 和 Creativity(§3, 附录 A)。
    • 误识别与搜索耗时例外:当检索包含正确身份但模型提交错误人选时,81.6% 会给出具体但错误的名字(§4.2);GLM-5.3 Flash 耗时 258 秒与 Gemini 3.7 Flash 耗时 41 秒准确率相当,额外搜索仅转化成延迟(§4.2)。
  5. 有什么可以进一步探索的点?

    作者指出源身份仅限网上自愿披露人群、访谈问题固定,且片段定位防御尚未在未知模型与下游任务上验证。

    作者指出的局限与后续方向

    • 源身份样本偏差:源身份仅覆盖在公开互联网上自我披露个人属性的个体,因此论文报告的数值不能作为人口层面的重识别风险估计(§5)。
    • 访谈问题结构单一:所有合成访谈均采用相同的 8 个核心问题(仅变动措辞和追问),尚未测试替代问题集对搜索行为和识别结果的影响(§5)。
    • 未解耦职业特征贡献:分析描述了不同职业语境之间的差异,但未隔离属性特异性、职业类别本身或网络足迹各自的独立贡献(§5)。
    • 片段定位防御泛化性待验证:片段选择管线在实际应用部署前,需要在新的人群、未见过的攻击者模型以及下游任务上进行验证评估(§5)。
    • 评估套件的扩展方向:模块化流水线支持未来扩展到其他来源人群、访谈形式和问题结构(§5)。

    实验覆盖范围

    • 评估模型范围:实验覆盖了 10 种基础模型共 15 种配置(含 4 组有无搜索消融),包括 GPT-5.6 Terra、GPT-5 Mini、GPT-4.1 Mini、Gemini 3.7 Flash、Gemini 3.1 Pro Preview 等专有模型,以及 DeepSeek-V4 Flash、GLM-5.3 Flash、Kimi K3、Llama-4 Maverick 等开源权重模型。
    • 基准数据规模与语言格式:AGENTDOXX 数据集包含 822 篇英语合成访谈,全部固定为 8 轮问答结构,涵盖 183 个归一化职业类别;动机研究覆盖了 Anthropic Interviewer 的全部 1,250 篇访谈。
    • 搜索环境与调用约束:网络搜索工具统一使用 Tavily API,设定上限为每篇访谈 10 次搜索、每次 15 个 URL 及高级搜索深度,且预先排除了来自 Reddit r/IAmA 的搜索结果。
    • 防御评估样本覆盖:防御有效性实验在分层抽样的 143 篇访谈上展开,测试了 Presidio NER 遮蔽、NER 结合改写、属性假值替换、系统提示词隐私指令,以及微调 Qwen-2.5-7B 进行关键片段定位 6 种条件。
    • 判定方式与阈值标准:重识别成功判定采用 nameparser 规范化与表面形式接受集合,匹配阈值固定为 Jaro-Winkler 相似度达到或超过 0.80。
  6. 总结一下论文的主要内容

    论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。
    • 定位与核心问题:本研究评估具备网络搜索工具的大语言模型智能体对去标识化文本的重识别风险;针对现有研究缺乏真实身份标注导致无法可靠测量风险与防御效果的问题,提出了具已知真实身份的评估套件 AGENTDOXX。
    • 评测方法与流程:基于 Reddit 的 r/IAmA 提取 822 位真实个体的公开属性,使用 GPT-5.4-mini 生成 8 轮结构的合成访谈并经双模型与人工脱敏审查;评测 15 种开源与专有模型配置在 Tavily 搜索下的直接重识别表现,并分析搜索时序轨迹与防御手段。
    • 参数化与检索双重风险:开源模型仅凭内部记忆无需搜索即可重识别 15.8%–27.7% 的访谈,搜索则使最强配置准确率达 47.0%–48.3%(Figure 3);目标一旦出现在检索结果中,全配置平均有 91.2% 的案例成功完成重识别(§4.2)。
    • 传统实体脱敏防御不足:基于 Presidio 的 NER 实体遮蔽后,143 篇分层样本中仍有 85.3% 至少被一个攻击者成功重识别(Table 2);属性假值替换虽使平均准确率降至 34.2%,但强推理模型常将事实矛盾视为听录噪音。
    • 提示词约束难以阻断过程泄露:系统提示词隐私约束虽使输出准确率降至 21.6%,但在拒绝给出姓名的样本中,37% 已在搜索过程中检索到了真实姓名,58% 在理由中披露了足以定位身份的关键细节(Table 3)。
    • 作者结论与启示:作者认为搜索增强智能体的隐私评估必须同时审计检索轨迹与最终输出;重识别能力已在开源模型中显现;针对复合属性的定向脱敏比单纯遮蔽命名实体更为必要。
阅读原文arxiv.org