跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

精选论文 26 篇
  1. 评测/基准arXiv:2610.08871 · 63

    CredLeak-Bench:七个模型在钓鱼场景下凭证泄露率 31%–76%,恢复率最高仅 24.2%

    作者评估 7 款 LLM 智能体,发现所有模型均存在凭据泄露,主恢复率最高仅 24.2%(GPT-5-mini,Table 10)。

    • 31.3%Claude Opus 4.8 在定向设定下的泄露率(Table 3)
    • 1.6%Claude Opus 4.8 在自主设定下的泄露率(Table 3)
    • 88.3%Claude Opus 4.8 在自主设定下的误拒率(Table 3)
    6 问速览评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。
    1. 这篇论文试图解决什么问题?

      评估 LLM 智能体在面对网络钓鱼时能否防范凭据泄露、保持合法任务完成度,以及能否通过受信渠道实现安全恢复。

    2. 有哪些相关研究?

      涵盖网页钓鱼检测、智能体安全与隐私评测、以及针对智能体的社会工程攻击研究,本文侧重成对控制与受信恢复能力。

    3. 论文如何解决这个问题?

      构建包含定向、自主和恢复三套件的成对测试沙盒,覆盖 8 种欺骗线索与 4 种框架,通过抓包日志判定凭据泄露与恢复。

    4. 论文做了哪些实验?

      7 款模型在定向与自主设定下均存在泄露,恢复率最高仅 24.2%,谨慎框架大幅压低完成率,域名验证可兼顾安全与效用。

    5. 有什么可以进一步探索的点?

      论文未设专门章节讨论局限;实验在本地沙盒中覆盖 7 款模型、8 类虚构服务以及三大评测套件。

    6. 总结一下论文的主要内容

      提出评测智能体凭据泄露与恢复的 CREDLEAK-BENCH,发现全模型均存在泄露且恢复率仅 0%–24.2%,揭示安全与效用权衡。

    完整解读
  2. 评测/基准arXiv:2605.01970 · 59

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    论文提出 Trojan Hippo Bench,未防御时 Gemini 3.1 Pro 在 N=100 触发会话下 ASR 达 100%。

    • 100%Gemini 3.1 Pro、Context 后端、未防御、N=100 会话 ASR(Table 3)
    • 85%GPT-5-mini、Mem0 后端、未防御、N=100 会话 ASR(Table 3)
    • 0%Gemini 3.1 Pro、Provable policy (IFC)、全部后端 N=100 ASR(Table 3)
    6 问速览针对智能体持久化记忆面临的潜伏型间接提示注入攻击,现有研究缺乏跨异构内存架构与考虑防御效用代价的动态评测基准。
    1. 这篇论文试图解决什么问题?

      针对智能体持久化记忆面临的潜伏型间接提示注入攻击,现有研究缺乏跨异构内存架构与考虑防御效用代价的动态评测基准。

    2. 有哪些相关研究?

      论文梳理了间接提示注入与数据窃取、智能体内存投毒与并发研究,以及攻击防御机制与动态评测三类相关工作。

    3. 论文如何解决这个问题?

      提出 Trojan Hippo Bench,结合 OpenEvolve 自适应红队搜索演化攻击载荷,并在 4 种内存后端评估 4 种内存层防御与 7 种能力流。

    4. 论文做了哪些实验?

      在 Gemini 3.1 Pro、GPT-5-mini 和 GPT-5 上评估了不同内存后端的持久潜伏 ASR、4 种防御效果、效用权衡及跨模型迁移。

    5. 有什么可以进一步探索的点?

      作者指出了 IFC 污点洗白与隐蔽信道、GPT-5 红队成本及多智能体扩展等局限,实验覆盖 3 个模型与 4 种内存后端。

    6. 总结一下论文的主要内容

      论文提出了评测智能体持久化记忆攻击与防御的 Trojan Hippo Bench,揭示了潜伏攻击威胁及内存防御的安全与效用权衡。

    完整解读
  3. 评测/基准arXiv:2610.05586 · 55

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    作者在具已知身份的 AGENTDOXX 上评测智能体重识别,发现目标入检后超88%被识别,提示词防御难阻搜索泄露。

    • 85.3%143篇访谈经Presidio实体遮蔽后至少被一个模型识别的比例(Table 2)
    • 91.2%目标姓名出现在检索结果后被模型正确识别的全配置平均比例(§4.2)
    • 27.7%在822篇访谈中Kimi K3无搜索下仅凭参数知识正确识别比例(Figure 3)
    6 问速览缺乏真实身份基准使搜索增强智能体的重识别风险与防御难以测量,论文提出具已知身份的评估套件 AGENTDOXX。
    1. 这篇论文试图解决什么问题?

      缺乏真实身份基准使搜索增强智能体的重识别风险与防御难以测量,论文提出具已知身份的评估套件 AGENTDOXX。

    2. 有哪些相关研究?

      涵盖传统统计链接、LLM 属性推断与端到端重识别、以及 NER 与 LLM 改写防御,缺乏搜索增强下的系统评估。

    3. 论文如何解决这个问题?

      基于 Reddit 构建 822 篇含真实身份的合成访谈套件,双模型审核脱敏,配合 Tavily 搜索智能体与规则匹配判定。

    4. 论文做了哪些实验?

      搜索使最强模型识别率达 48%,目标入检索超 88% 成功,实体遮蔽后仍超八成被识别,提示词防御存在轨迹泄露。

    5. 有什么可以进一步探索的点?

      作者指出源身份仅限网上自愿披露人群、访谈问题固定,且片段定位防御尚未在未知模型与下游任务上验证。

    6. 总结一下论文的主要内容

      论文提出了已知身份的重识别基准 AGENTDOXX,揭示搜索与记忆双重风险及现有防御在检索轨迹中的泄露漏洞。

    完整解读
  4. 评测/基准arXiv:2609.08258 · 54

    研究实测五套 Agent 记忆系统均不执行撤销标记

    评测5个智能体记忆系统发现均未默认执行软撤回,直接插入无防御下智能体在暴露系统选择不安全行动达43.1%(699/1620)。

    • 43.1%两暴露系统直接插入无防御下9模型不安全行动率(Table 6)
    • 0.0%两暴露系统在store filter防御下的不安全行动率(Table 6)
    • 81.0%两暴露系统直接插入无提示规则场景不安全行动率(Table 8)
    6 问速览检验智能体记忆系统的软撤回机制在运行时是否真正执行,防止被废止的失效记录继续误导智能体做出不安全行动。
    1. 这篇论文试图解决什么问题?

      检验智能体记忆系统的软撤回机制在运行时是否真正执行,防止被废止的失效记录继续误导智能体做出不安全行动。

    2. 有哪些相关研究?

      梳理了记忆系统、记忆投毒攻击、生命周期安全、护栏与来源检查、版本感知检索五类工作,明确本文关注检索时有效性而非来源检查。

    3. 论文如何解决这个问题?

      设计两阶段评测流水线量化暴露率与不安全率,并提出不依赖后端的两阶段防护组件在读取路径拦截已标记撤回或冲突的陈旧记录。

    4. 论文做了哪些实验?

      评测覆盖9模型、5系统与6种防御,发现无防御暴露系统下不安全率达43.1%,写回会击穿存储过滤使不安全率升至83.1%。

    5. 有什么可以进一步探索的点?

      作者指出缺乏原生检索时有效性检查与间接插入识别不足等局限;实验未覆盖动态演化长序列及更多非结构化复杂场景。

    6. 总结一下论文的主要内容

      系统揭示了记忆系统软撤回在检索时普遍未执行的安全漏洞,证明写回会击穿现有防御,并提出读取端防护作为必要控制手段。

    完整解读
  5. 评测/基准arXiv:2609.32915 · 55

    AgentTell:浏览器 Agent 的行为侧信道泄漏基准

    研究评估了六个模型在 AGENTTELL 基准上的行为侧信道,发现智能体在 61.1% 的载入会话中通过操作泄露了前站隐私。

    • 61.1%全模型7630次载入会话平均泄露率(Finding 1)
    • 56.7%显式记录保密记忆后的会话泄露率(Finding 2)
    • 34.5%4663次泄露会话中虚假保证隐私比例(Finding 3)
    6 问速览智能体在跨网页操作中因上下文记忆,通过普通行为选择无意泄露前站隐私信息。
    1. 这篇论文试图解决什么问题?

      智能体在跨网页操作中因上下文记忆,通过普通行为选择无意泄露前站隐私信息。

    2. 有哪些相关研究?

      论文梳理了智能体安全注入、Web隐私规范与浏览器跨源状态推断三类相关研究。

    3. 论文如何解决这个问题?

      通过构建等效可完成的通用与特定动作,结合冷热运行对比提出净泄露分度量指标。

    4. 论文做了哪些实验?

      六个基座平均泄露分为53.4至65.7点,且超三分之一泄露会话存在虚假安全陈述。

    5. 有什么可以进一步探索的点?

      作者指出了合成网站与完整历史保留等局限;实验覆盖了6个模型在本地环境的评测。

    6. 总结一下论文的主要内容

      论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。

    完整解读
已经到底了