跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

精选论文 26 篇
  1. 攻击arXiv:2609.04533 · 59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    作者针对黑盒VLM提出自适应视觉提示注入,在DocVQA下对GPT-5.5实现47%工具调用ASR(Table 2)。

    • 47%GPT-5.5在DocVQA的Call-Tool ASR(Table 2)
    • 90%Opus-4.7在DocVQA的Steal-PII ASR(Table 2)
    • 96%Qwen3.6-27B在DocVQA的Call-Tool ASR(Table 2)
    6 问速览现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。
    1. 这篇论文试图解决什么问题?

      现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。

    2. 有哪些相关研究?

      相关研究涵盖视觉越狱、白盒对抗图像与多模态提示注入基准,但多放宽了良性指令竞争或黑盒限制。

    3. 论文如何解决这个问题?

      作者将攻击重塑为响应前缀控制,结合自动化黑盒自适应精炼与成功注入攻击库,诱导目标模型产生精确输出。

    4. 论文做了哪些实验?

      实验覆盖六款VLM与三个场景,该方法的工具调用与隐私窃取ASR均超过基线,并在OpenClaw智能体中实现越权。

    5. 有什么可以进一步探索的点?

      作者指出了高查询量导致API开销大、未测试tool return图像输入以及未针对防御展开自适应攻击等局限。

    6. 总结一下论文的主要内容

      论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    完整解读
  2. 防御arXiv:2609.14003 · 56

    FlowSeal:用信息流控制阻断 LLM Agent 的隐私泄露

    作者针对智能体隐私泄漏提出FLOWSEAL防御,在SPR基准上将CWL攻击的条目泄漏率从52.2%降至0.5%。

    • 0.5%DeepSeek-V3.2下SPR基准CWL攻击FLOWSEAL的LRI
    • 52.2%DeepSeek-V3.2下SPR基准CWL攻击SPR-D2的LRI
    • 2.3%DeepSeek-V3.2下SPR基准SOA攻击FLOWSEAL的LRI
    6 问速览解决现有提示词防御在对手控制的上下文中做隐私判定导致机制与攻击面重合的问题。
    1. 这篇论文试图解决什么问题?

      解决现有提示词防御在对手控制的上下文中做隐私判定导致机制与攻击面重合的问题。

    2. 有哪些相关研究?

      梳理智能体隐私基准、基于模型的隐私防御及信息流控制,指出本文将强制执行移至上下文外。

    3. 论文如何解决这个问题?

      FLOWSEAL在工具边界设立代码拦截器,结合数据溯源、三级格策略与独立内容检查实现信息流控制。

    4. 论文做了哪些实验?

      在三项基准、多种模型与真实MCP测试中,FLOWSEAL将新型攻击泄漏率压至2.3%以下并保持72.4%实用率。

    5. 有什么可以进一步探索的点?

      作者指出检查器存在改写漏检与误拒局限,未登记数据存在盲区,未来可探索系统层多层防御。

    6. 总结一下论文的主要内容

      作者分析大模型智能体隐私检查与攻击面重合问题,提出外部拦截防御FLOWSEAL并验证有效性。

    完整解读
  3. 评测/基准arXiv:2609.32915 · 55

    AgentTell:浏览器 Agent 的行为侧信道泄漏基准

    研究评估了六个模型在 AGENTTELL 基准上的行为侧信道,发现智能体在 61.1% 的载入会话中通过操作泄露了前站隐私。

    • 61.1%全模型7630次载入会话平均泄露率(Finding 1)
    • 56.7%显式记录保密记忆后的会话泄露率(Finding 2)
    • 34.5%4663次泄露会话中虚假保证隐私比例(Finding 3)
    6 问速览智能体在跨网页操作中因上下文记忆,通过普通行为选择无意泄露前站隐私信息。
    1. 这篇论文试图解决什么问题?

      智能体在跨网页操作中因上下文记忆,通过普通行为选择无意泄露前站隐私信息。

    2. 有哪些相关研究?

      论文梳理了智能体安全注入、Web隐私规范与浏览器跨源状态推断三类相关研究。

    3. 论文如何解决这个问题?

      通过构建等效可完成的通用与特定动作,结合冷热运行对比提出净泄露分度量指标。

    4. 论文做了哪些实验?

      六个基座平均泄露分为53.4至65.7点,且超三分之一泄露会话存在虚假安全陈述。

    5. 有什么可以进一步探索的点?

      作者指出了合成网站与完整历史保留等局限;实验覆盖了6个模型在本地环境的评测。

    6. 总结一下论文的主要内容

      论文评估了浏览器智能体的行为侧信道泄露风险,并基于近万次会话提供了评测数据。

    完整解读
  4. 攻击arXiv:2609.13889 · 56

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    作者针对OpenClaw和Claude Code评估持久记忆投毒攻击PMPA,诱导其跨会话执行恶意动作并造成隐私泄露。

    • 73.7%OpenClaw所有设置平均ISR(摘要)
    • 55.5%OpenClaw所有设置平均C-ASR(摘要)
    • 66.9%Claude Code所有设置平均ISR(摘要)
    6 问速览论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。

    2. 有哪些相关研究?

      相关研究涵盖智能体与 harness 工程、提示注入攻击以及后门与记忆投毒攻击三类。

    3. 论文如何解决这个问题?

      论文提出了持久记忆投毒攻击 PMPA,通过两阶段工作流与三组件载荷设计,诱导智能体将外部恶意规则存入持久记忆并跨会话触发。

    4. 论文做了哪些实验?

      论文在两个智能体和三个模型上测得平均 ISR 达 66.9%–73.7%,跨会话 C-ASR 达 55.5%–81.7%,且防御对已写入记忆防护有限。

    5. 有什么可以进一步探索的点?

      作者计划未来在更广泛设置与更多模型上评估该攻击,并探索针对持久记忆投毒更有效的防御手段。

    6. 总结一下论文的主要内容

      论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    完整解读
  5. 攻击arXiv:2609.36941 · 53

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    作者通过扰动蒸馏本地代理与离线过滤提取黑盒大模型凭据,真实key平均恢复数较直接查询提升11.8%–25.0%(Table 1)。

    • 25.0%DeepSeek-Coder-7B上RS均值较基线提升(Table 1)
    • 11.8%LLaMA-3-8B上RS均值较直接查询基线提升(Table 1)
    • 2.6×弱扰动下真实凭据比例RR较DESEC最大提升(Table 2)
    6 问速览针对商业大模型仅有输出访问权限且缺乏原始上下文的限制,解决代码模型记忆的高熵 API key 提取与防幻觉问题。
    1. 这篇论文试图解决什么问题?

      针对商业大模型仅有输出访问权限且缺乏原始上下文的限制,解决代码模型记忆的高熵 API key 提取与防幻觉问题。

    2. 有哪些相关研究?

      现有工作包括基于代码补全的 HCR、白盒概率引导的 DESEC 及 PII 提取,但均未解决黑盒高熵凭据定向提取。

    3. 论文如何解决这个问题?

      通过 5 种代码前缀扰动与硬标签蒸馏构建本地白盒代理,再通过离线截断采样与局部熵及 4-gram 重复抑制筛选真凭据。

    4. 论文做了哪些实验?

      在 3 个受害模型上真实凭据恢复数提升 11.8%–25.0%,延迟降 20.7–34.8 倍,并从 3 个商业模型中提取出真实凭据。

    5. 有什么可以进一步探索的点?

      作者计划未来开源代码并呼吁更严格的数据清洗,实测未向外部接口发送实时请求;受控实验覆盖 3 个受害模型与 5 家凭据。

    6. 总结一下论文的主要内容

      论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。

    完整解读
  6. 攻击arXiv:2609.33985 · 55

    研究:众包微调数据投毒可放大专有指令抽取

    注入50条主题中毒样本使Qwen2.5-14B在OpenMathInstruct上近原样提取率达良性微调的3.71倍。

    • 8.84%Qwen2.5-14B在OpenMathInstruct上50条中毒样本的近原样提取率
    • 3.71×Qwen2.5-14B在OpenMathInstruct上50条中毒样本相对良性微调的提取倍率
    • 6.07%Llama-3.1-8B在AceReason上100条中毒样本的直接提交近原样提取率
    6 问速览研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。
    1. 这篇论文试图解决什么问题?

      研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。

    2. 有哪些相关研究?

      涵盖预训练与微调数据提取、众包微调数据集构建,以及基于数据中毒的隐私推断与数据窃取攻击。

    3. 论文如何解决这个问题?

      构建领域主题锚点注入提取引导样本,并利用未微调代理模型的不确定性自适应筛选高收益锚点进行查询。

    4. 论文做了哪些实验?

      在 4 个模型与 2 个数据集上评估了直接提交与托管交互中毒,并测试了 4 种防御过滤方法及模型蒸馏效用。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限,其实验覆盖了 4 个开源模型、2 个核心数据集、4 种异常检测方法与多种预算配置。

    6. 总结一下论文的主要内容

      论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    完整解读
已经到底了