AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测
构建AGENTDOXX评测联网搜索智能体对匿名访谈的再识别能力
- 定位与核心问题:本研究评估具备网络搜索工具的大语言模型智能体对去标识化文本的重识别风险;针对现有研究缺乏真实身份标注导致无法可靠测量风险与防御效果的问题,提出了具已知真实身份的评估套件 AGENTDOXX。
- 评测方法与流程:基于 Reddit 的 r/IAmA 提取 822 位真实个体的公开属性,使用 GPT-5.4-mini 生成 8 轮结构的合成访谈并经双模型与人工脱敏审查;评测 15 种开源与专有模型配置在 Tavily 搜索下的直接重识别表现,并分析搜索时序轨迹与防御手段。
- 参数化与检索双重风险:开源模型仅凭内部记忆无需搜索即可重识别 15.8%–27.7% 的访谈,搜索则使最强配置准确率达 47.0%–48.3%(Figure 3);目标一旦出现在检索结果中,全配置平均有 91.2% 的案例成功完成重识别(§4.2)。
- 传统实体脱敏防御不足:基于 Presidio 的 NER 实体遮蔽后,143 篇分层样本中仍有 85.3% 至少被一个攻击者成功重识别(Table 2);属性假值替换虽使平均准确率降至 34.2%,但强推理模型常将事实矛盾视为听录噪音。
- 提示词约束难以阻断过程泄露:系统提示词隐私约束虽使输出准确率降至 21.6%,但在拒绝给出姓名的样本中,37% 已在搜索过程中检索到了真实姓名,58% 在理由中披露了足以定位身份的关键细节(Table 3)。
- 作者结论与启示:作者认为搜索增强智能体的隐私评估必须同时审计检索轨迹与最终输出;重识别能力已在开源模型中显现;针对复合属性的定向脱敏比单纯遮蔽命名实体更为必要。