跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.30094· Luciano Maldonado·· 7 天前

PrivDrift:审计活跃 LLM 对话中话题漂移下的用户秘密泄露

PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations

AI 导读

研究者提出 PrivDrift 基准,用于审计用户披露的秘密在对话话题漂移和说服式探测后是否仍可被恢复。该基准包含 1000 组受控多轮对话,设有植入秘密、内容密集的漂移轮次和标准化提取探测。在三个具备扩展上下文窗口的 LLM 上,对话级混合泄露率在 38.7% 至 54.6% 之间,并随模型、秘密类型和说服强度明显变化。在测试的漂移窗口内,额外的话题漂移并未可靠降低泄露,作者据此认为活跃 LLM 场景中的隐私风险应被视为持续的行为失效模式,而非仅训练数据记忆或即时越狱行为。

阅读原文arxiv.org