跳到正文
10月8日 · 周四

隐私与数据泄露 · 论文

精选论文 26 篇
  1. 攻击arXiv:2610.09981 · 59

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    研究评估网关记录的LLM路由元数据泄露:50%运行点匹配长度下,RouteLLM未见提示词上骚扰与自残调用强模型少19点。

    • -0.193RouteLLM,LMSYS未见提示词,50%运行点,骚扰类别匹配长度差值∆adj(Table IV)
    • -0.186RouteLLM,LMSYS未见提示词,50%运行点,自残类别匹配长度差值∆adj(Table IV)
    • +0.102RouteLLM,LMSYS保留集全部样本,50%运行点,涉性类别匹配长度差值∆adj(Table IV)
    6 问速览网关记录的LLM路由模型选择元数据,在不记录内容时也会成为泄露敏感话题的侧信道。
    1. 这篇论文试图解决什么问题?

      网关记录的LLM路由模型选择元数据,在不记录内容时也会成为泄露敏感话题的侧信道。

    2. 有哪些相关研究?

      论文将研究归纳为成本与领域路由、隐私保护路由及自适应系统侧信道,强调自身聚焦真实业务日志泄露。

    3. 论文如何解决这个问题?

      通过长度匹配差值度量泄露,构建账单与逐条日志推断攻击,并设计按类别长度匹配公平性后处理以消除单请求差距。

    4. 论文做了哪些实验?

      实测显示强模型路由偏差方向依类别而异,账单攻击可推断用户医疗频率,按类别公平性可低成本闭合单请求差距。

    5. 有什么可以进一步探索的点?

      医疗标签质量、重复提示词干扰、用户级证据仅限于单一类别以及商用托管路由器尚未实测是核心局限。

    6. 总结一下论文的主要内容

      论文揭示并测量了LLM路由决策在无文本日志中的敏感话题泄露,验证了按类别公平性防御的有效性与边界。

    完整解读
  2. 攻击arXiv:2604.02623 · 56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    作者通过网页向 Web 智能体注入带条件的轨迹记忆,在 GPT-5-mini 上挫败感利用与混沌结合时 ASRB 达 32.5%。

    • 32.5%GPT-5-mini在挫败感利用与混沌工程下的ASRB(Table 1)
    • 23.4%GPT-5.2在挫败感利用与混沌工程下的ASRB(Table 1)
    • 22.3%GPT-5.2在权威框架策略无混沌下的ASRB(Table 1)
    6 问速览作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。
    1. 这篇论文试图解决什么问题?

      作者研究基于原始轨迹记忆的 Web 智能体在无需直接访问存储时遭受跨会话、跨网站环境注入记忆投毒攻击的风险。

    2. 有哪些相关研究?

      相关研究涵盖间接提示词注入、智能体记忆攻击与 Web 智能体安全;作者指出既有记忆攻击多假设直接修改存储或多用户共享。

    3. 论文如何解决这个问题?

      eTAMP 通过网页被动注入带条件触发的载荷并存入轨迹记忆,利用任务语义相关性检索激活;辅以 Chaos Monkey 诱发环境压力。

    4. 论文做了哪些实验?

      eTAMP 在 GPT-5-mini 和 GPT-5.2 上分别取得最高 32.5% 和 23.4% 的 ASRB;混沌压力使部分模型易感性增加数倍。

    5. 有什么可以进一步探索的点?

      作者指出了仅研究原始轨迹记忆、未系统评估主动防御、召回测试仅用单一提示词等局限与后续方向。

    6. 总结一下论文的主要内容

      论文提出了基于环境注入的跨任务记忆投毒攻击 eTAMP,作者报告智能体在环境压力下易感性增加且能力与安全并不协同。

    完整解读
  3. 攻击arXiv:2610.09920 · 54

    研究:多向量视觉文档索引可被反演还原页面内容

    针对多向量视觉检索器,论文在零侧信息下重构页面,原始索引重识别top-1达98.4%且打乱顺序可被恢复。

    • 47.4%EA原始索引在ViDoRe v3上的词召回率(Table 1)
    • 45.0%EA原始索引在ViDoRe v3上的敏感token召回率(Table 1)
    • 98.4%EA原始索引逆向页面在19,252页库中的重识别top-1(Table 1)
    6 问速览评估仅凭第三方托管的多向量索引能否在零侧信息下逆向重构成清晰文档页面。
    1. 这篇论文试图解决什么问题?

      评估仅凭第三方托管的多向量索引能否在零侧信息下逆向重构成清晰文档页面。

    2. 有哪些相关研究?

      涵盖文本与图像特征逆向、多向量检索压缩及RAG系统隐私,定位在视觉索引逆向。

    3. 论文如何解决这个问题?

      基于MMDiT流匹配,结合编码器指纹匹配、周期性形状推断与匈牙利算法重排。

    4. 论文做了哪些实验?

      在ViDoRe v3上测试原始索引、池化与打乱防护,原始索引重识别达98.4%。

    5. 有什么可以进一步探索的点?

      编码器限于Qwen系ColPali模型,未测试私有模型与加密防御,池化逆向仍未解决。

    6. 总结一下论文的主要内容

      揭示多视觉文档索引存在逆向风险,原始索引达98.4%重识别且打乱防护可被攻破。

    完整解读
  4. 攻击arXiv:2610.04195 · 59

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    作者评估多租户智能体共享向量记忆,在同团队池化检索下MiniLM跨用户泄漏率达70%,硬门控可阻断。

    • 70%all-MiniLM-L6-v2在T0同团队池化检索下的跨用户泄漏率LR(Table 1)
    • 90%–100%Config B下主动构造记忆在三个场景的top-k命中率Pl.%(Table 2)
    • 5.00/5Gemini 2.5 Flash在Config B检索路径下的下游回答污染度(Table 5)
    6 问速览论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。
    1. 这篇论文试图解决什么问题?

      论文研究多租户智能体共享向量存储时,嵌入空间语义相近导致跨用户私密记忆被意外检索并注入上下文的泄漏问题。

    2. 有哪些相关研究?

      梳理了智能体记忆架构、单用户记忆安全、RAG攻击与嵌入隐私研究,指出现有工作未覆盖多租户下非攻击性语义泄漏。

    3. 论文如何解决这个问题?

      形式化跨用户可采纳性失效,构建四层级组织距离数据集,对比被动与主动桥接攻击,并设计存储、嵌入与检索后三层防御。

    4. 论文做了哪些实验?

      在 4 级组织距离和 3 个场景下评测表明,池化检索引发 70–100% 泄漏与污染,硬门控可无损复原但增加 1.4 ms 延迟。

    5. 有什么可以进一步探索的点?

      作者指出了小样本合成数据、自评审偏差及信道编码不足等局限;实验主要覆盖两款生成模型及四对合成用户。

    6. 总结一下论文的主要内容

      论文揭示共享向量库导致的跨用户语义泄漏,指出常识构造攻击可达90–100%命中,而硬所有权门控能以低延迟恢复隔离。

    完整解读
  5. 攻击arXiv:2610.06848 · 55

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    研究者针对静态无分支Transformer提出TRANSCOPE,通过CPU硬件计数器检测成员,在BERT-base上AUC达0.99。

    • 99%BERT-base在Structured v Random下的攻击准确率(据Table III)
    • 0.99BERT-base在Structured v Random下的AUC(据Table III)
    • d = 2.52ViT-base在Sapphire Rapids上ASSISTS.FP效应量(据Figure 10)
    6 问速览论文解决在无动态分支、输出被遮蔽且执行时间恒定的黑盒大模型上,如何检测训练集成员与版权数据泄露问题。
    1. 这篇论文试图解决什么问题?

      论文解决在无动态分支、输出被遮蔽且执行时间恒定的黑盒大模型上,如何检测训练集成员与版权数据泄露问题。

    2. 有哪些相关研究?

      论文系统梳理了软件级成员推断、硬件辅助隐私攻击及属性推断研究,将本文定位为首个针对静态恒定时间模型的微架构MIA。

    3. 论文如何解决这个问题?

      TRANSCOPE利用分词器词元间隔诱导的嵌入表访问局部性差异,通过五个阶段收集并聚合263个CPU硬件计数器证据。

    4. 论文做了哪些实验?

      实验在BERT、GPT-2、Pythia与ViT上评估,主结果显示多模型准确率达90%–100%,真实版权数据测试中非核心读取减少56%。

    5. 有什么可以进一步探索的点?

      论文未专门讨论自身局限,提出了硬件重构与信道容量计算方向;实验覆盖了特定CPU、模型规模与测试集。

    6. 总结一下论文的主要内容

      TRANSCOPE揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    完整解读
  6. 攻击arXiv:2610.04589 · 58

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究评估了智能体记忆作为隐写隐蔽信道的风险,14,000次试验中20.1%实现确切恢复,主要损耗在写入持久化阶段。

    • 20.1%全部14,000次试验中合成机密确切匹配恢复率(全基准聚合)
    • 41.2%全部14,000次试验中生成响应成功编码率(全基准聚合)
    • 29.8%全部14,000次试验中编码在写入持久化后存活率(全基准聚合)
    6 问速览论文探讨智能体持久化记忆是否会被利用为跨会话隐写隐蔽信道,规避安全监视并实现非授权信息传递。
    1. 这篇论文试图解决什么问题?

      论文探讨智能体持久化记忆是否会被利用为跨会话隐写隐蔽信道,规避安全监视并实现非授权信息传递。

    2. 有哪些相关研究?

      论文梳理了智能体记忆投毒、文本隐写及认知架构等相关工作,将本文定位为对智能体记忆隐写信道的系统评测。

    3. 论文如何解决这个问题?

      设计两会话隔离协议与StegoMemory基准,将隐写载荷嵌入良性主任务,经记忆流水线后由离线解码器还原。

    4. 论文做了哪些实验?

      13个模型14,000次试验中确切恢复率为20.1%,12个模型损耗集中于写入阶段,格式错误是主要编码阻碍。

    5. 有什么可以进一步探索的点?

      论文指出了流水线固定、方案静态、确切匹配标准保守等局限,且实验覆盖范围限于特定合成设置与表面监视。

    6. 总结一下论文的主要内容

      研究揭示智能体持久记忆可作为隐蔽信道跨会话传输机密,写入持久化是主要防御瓶颈,呼吁建立记忆完整性防御。

    完整解读
  7. 攻击arXiv:2609.18217 · 67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    作者测定12个LLM对MCP通道的信任,双通道分段使GPT-4o遵从率从单通道0%升至100%(Table IV)。

    • 100%GPT-4o在2-ch分段下的Compliance率(Table IV)
    • 82%12个模型在2-ch分段下的平均Compliance率(Section IV-B)
    • 42%12个模型在单通道直接注入下的平均Compliance率(Section IV-B)
    6 问速览论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决MCP工具调用中缺乏权限隔离导致各通道被差异化信任与跨通道分段利用的安全问题。

    2. 有哪些相关研究?

      论文梳理了提示注入基准、MCP专项攻击及注入防御三类工作,指出以往研究未评估多通道信任差异与跨通道分段攻击。

    3. 论文如何解决这个问题?

      论文提出了通道信任测量框架、双通道与三通道分段攻击、价值对齐利用以及采样系统提示词覆盖攻击。

    4. 论文做了哪些实验?

      论文测试了12个模型与4款生产客户端,表明跨通道分段使遵从率倍增,且能绕过现有7款MCP安全工具。

    5. 有什么可以进一步探索的点?

      作者指出了隔离提示词小节贡献与评估双LLM防御等局限,实际评测覆盖了12个模型及4款主流客户端。

    6. 总结一下论文的主要内容

      论文揭示了MCP多通道隐式信任层级,通过跨通道分段与协议级利用突破现有防御,展示了严重的凭证外发风险。

    完整解读
  8. 攻击arXiv:2610.01365 · 53

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    作者提出无真实私有监督的恢复攻击 ReGap,在 GPT-2 Medium 上将目标关联恢复率从 42.0% 提升至 63.0%(Figure 2)。

    • 63.0%GPT-2 Medium在Enron目标集上经ReGap单轮微调后的恢复率(Figure 2)
    • 72.0%GPT-2 Large在Enron目标集上经ReGap单轮微调后的恢复率(Figure 2)
    • 57.3%GPT-2 Medium在未见身份对照中ReGap单轮微调后的恢复率(Table 1)
    6 问速览探究在缺乏真实私有数据监督的现实条件下,能否仅凭模型自身生成的数据通过微调重新恢复语言模型中潜在的隐私关联。
    1. 这篇论文试图解决什么问题?

      探究在缺乏真实私有数据监督的现实条件下,能否仅凭模型自身生成的数据通过微调重新恢复语言模型中潜在的隐私关联。

    2. 有哪些相关研究?

      梳理了模型记忆提取、行为遗忘以及后适应微调隐私风险等研究,将本文定位为无需真实私有监督的后适应恢复攻击。

    3. 论文如何解决这个问题?

      提出由生成、筛选、微调构成的 ReGap 流程,基于冻结模型似然挑选高支持度伪监督,以 LoRA 降低目标关联损失。

    4. 论文做了哪些实验?

      作者在 6 个模型上测试了 ReGap,恢复率提升 6–21 个百分点,对照实验显示其依赖先验暴露且对不透明绑定失效。

    5. 有什么可以进一步探索的点?

      作者指出当前研究聚焦于结构化 Enron 数据与开源模型,未来需探索低结构化隐私、受限微调接口及更多防御机制。

    6. 总结一下论文的主要内容

      提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    完整解读
  9. 攻击arXiv:2607.25560 · 53

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    作者针对黑盒智能体提出 SigLeak 框架,仅凭良性查询配对轨迹比对推断专有技能,全场景平均提升成功率 6.88 个百分点。

    • 6.88 pp全场景及全模型配置下,SigLeak 相对无技能基准的平均 SR 增益(Table 1)
    • 84.59%Spreadsheet 场景下,SigLeak 在 6 种配置上的平均 SR(Table 1)
    • 22.8%GPT-5.4-mini 上,SigLeak 跨 5 场景的细粒度 SkillSim 平均 F1(Figure 4a)
    6 问速览探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。
    1. 这篇论文试图解决什么问题?

      探究黑盒智能体专有技能如何通过良性查询激发的执行轨迹产生行为侧信道泄露,并提出非侵入式推断框架。

    2. 有哪些相关研究?

      梳理了智能体技能构建、基于轨迹反馈的技能演化,以及指令与轨迹泄露相关研究,并指明与本文黑盒良性推断的区别。

    3. 论文如何解决这个问题?

      提出 SigLeak 框架,通过两阶段工作流生成高决策密度探针,并比对配对轨迹差异提取签名以迭代重构专有技能。

    4. 论文做了哪些实验?

      跨 5 个场景、3 个模型家族与 3 种框架评估,SigLeak 平均提升成功率 6.88 个百分点且在细粒度语义匹配上保持领先。

    5. 有什么可以进一步探索的点?

      作者指出了固定探针预算与提示模板等局限并提出自适应探索方向,实验覆盖了 5 个场景及 4 个代表性模型。

    6. 总结一下论文的主要内容

      提出了通过良性查询和对照轨迹推断黑盒专有技能的 SigLeak 框架,揭示了智能体执行可见性带来的行为侧信道泄露风险。

    完整解读
  10. 攻击arXiv:2609.04382 · 56

    研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过

    作者对双节点拆分训练系统进行安全审计,发现未受保护的反向梯度以零支撑结构完全暴露诱饵行,联合视图突破门控。

    • 4,096/4,096主配置下9个种子所有帧反向梯度零支撑结构精确识别真实行
    • +0.92 ppQwen3-0.6B主配置9个打包代码种子梯度臂高频token配对效应均值
    • +2.180 ppQwen3-0.6B浅层切分种子52防御开放梯度下联合臂门控统计量
    6 问速览拆分训练中评估工具未覆盖反向传播信道,导致未受保护的梯度完全泄露真实数据与诱饵行划分。
    1. 这篇论文试图解决什么问题?

      拆分训练中评估工具未覆盖反向传播信道,导致未受保护的梯度完全泄露真实数据与诱饵行划分。

    2. 有哪些相关研究?

      论文对比了拆分学习双向攻防、差分隐私审计协议与无校准对照的外部拆分评估研究。

    3. 论文如何解决这个问题?

      通过枚举攻击信道、注入校准指标、预设决策门控,并利用零支撑梯度精确剥离诱饵行。

    4. 论文做了哪些实验?

      反向梯度在全部 4,096 帧完全暴露诱饵行,联合视图突破门控,裁剪加噪以微小代价消除泄漏。

    5. 有什么可以进一步探索的点?

      作者指出了 5 类未测量信道与未覆盖全序列重构等局限,评测范围集中于单一模型与语料。

    6. 总结一下论文的主要内容

      论文揭示拆分训练中反向梯度零支撑完全暴露诱饵行,联合视图突破门控,裁剪加噪可有效缓解。

    完整解读
  11. 攻击arXiv:2608.09867 · 67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    作者发现商业API加密思维块可在同厂商模型间互通,利用弱模型可绕过前沿模型防护并逐字解密其思维链。

    • 4.9%6,708条公开轨迹解码后至少泄露一项敏感信息的会话比例(据4.1节)
    • 62从真实用户会话解密思维块中恢复的独立API密钥数(据Table 4)
    • 64真实用户会话中仅存在于加密思维而在可见文本中未出现的敏感项数(据Table 4)
    6 问速览论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。
    1. 这篇论文试图解决什么问题?

      论文发现商业API加密思维块可在模型间互换,形成绕过强模型对齐的弱模型解密通道。

    2. 有哪些相关研究?

      相关工作涉及黑盒模型蒸馏、加密思维块分析、思维链安全与智能体长程注入等方向。

    3. 论文如何解决这个问题?

      将强模型的加密块注入同厂商未严格对齐的弱模型,诱导其逐字转写明文并辅以重构校验。

    4. 论文做了哪些实验?

      实验证实三大厂商模型思维可接近1:1解码,公开轨迹恢复出62个API密钥等敏感凭证。

    5. 有什么可以进一步探索的点?

      作者指出评估受限于特定版本API且无法访问真实明文,评测未穷尽所有公开智能体数据集。

    6. 总结一下论文的主要内容

      论文揭示了客户端加密思维块跨模型互换漏洞,提出了低成本提取方法并给出防御方案。

    完整解读
  12. 攻击arXiv:2607.05189 · 58

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    MEMGHOST利用环境与目标双代理离线训练,在OpenClaw+GPT-5.4后台模式取得87.5%端到端记忆注入成功率。

    • 87.5%OpenClaw+GPT-5.4 后台模式 E2E 成功率(Table I)
    • 75.0%OpenClaw+GPT-5.4 前台模式 E2E 成功率(Table I)
    • 71.4%Claude Code SDK+Sonnet 4.6 后台模式 E2E(Table I)
    6 问速览论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。
    1. 这篇论文试图解决什么问题?

      论文研究个人智能体在黑盒无交互下,通过单封外部邮件被静默写入持久记忆并操控后续会话的长程攻击威胁。

    2. 有哪些相关研究?

      梳理了智能体安全评估、间接提示词注入与记忆投毒研究,指出现存工作缺乏对外部无交互全周期记忆注入的建模。

    3. 论文如何解决这个问题?

      通过轻量影子环境与细则奖励双代理,利用 SFT 与 GRPO 训练生成策略,实现单次前向生成免交互隐蔽邮件。

    4. 论文做了哪些实验?

      在 6 种模型及多框架上验证,MEMGHOST 在前沿与低成本模型上显著优于 7 种基线并实现跨架构迁移。

    5. 有什么可以进一步探索的点?

      作者指出未覆盖投递层基础设施、多模态载荷与长期衰减;实验覆盖了 6 类模型与 4 种智能体框架。

    6. 总结一下论文的主要内容

      总结了论文的研究背景、双代理优化方法 MEMGHOST、全周期实验结果以及作者对记忆信任边界的启示。

    完整解读
  13. 攻击arXiv:2609.04533 · 59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    作者针对黑盒VLM提出自适应视觉提示注入,在DocVQA下对GPT-5.5实现47%工具调用ASR(Table 2)。

    • 47%GPT-5.5在DocVQA的Call-Tool ASR(Table 2)
    • 90%Opus-4.7在DocVQA的Steal-PII ASR(Table 2)
    • 96%Qwen3.6-27B在DocVQA的Call-Tool ASR(Table 2)
    6 问速览现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。
    1. 这篇论文试图解决什么问题?

      现有视觉提示注入在黑盒商用VLM上难以诱发有害行为,论文提出通过前缀诱导在良性任务下实现精确有害输出。

    2. 有哪些相关研究?

      相关研究涵盖视觉越狱、白盒对抗图像与多模态提示注入基准,但多放宽了良性指令竞争或黑盒限制。

    3. 论文如何解决这个问题?

      作者将攻击重塑为响应前缀控制,结合自动化黑盒自适应精炼与成功注入攻击库,诱导目标模型产生精确输出。

    4. 论文做了哪些实验?

      实验覆盖六款VLM与三个场景,该方法的工具调用与隐私窃取ASR均超过基线,并在OpenClaw智能体中实现越权。

    5. 有什么可以进一步探索的点?

      作者指出了高查询量导致API开销大、未测试tool return图像输入以及未针对防御展开自适应攻击等局限。

    6. 总结一下论文的主要内容

      论文提出了针对黑盒VLM的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    完整解读
  14. 攻击arXiv:2609.13889 · 56

    PMPA:针对 OpenClaw 与 Claude Code 的持久记忆投毒攻击

    作者针对OpenClaw和Claude Code评估持久记忆投毒攻击PMPA,诱导其跨会话执行恶意动作并造成隐私泄露。

    • 73.7%OpenClaw所有设置平均ISR(摘要)
    • 55.5%OpenClaw所有设置平均C-ASR(摘要)
    • 66.9%Claude Code所有设置平均ISR(摘要)
    6 问速览论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。
    1. 这篇论文试图解决什么问题?

      论文试图解决基于 harness 设计的智能体在无直接访问权限下被外部源持久记忆投毒并引发跨会话隐私泄露的问题。

    2. 有哪些相关研究?

      相关研究涵盖智能体与 harness 工程、提示注入攻击以及后门与记忆投毒攻击三类。

    3. 论文如何解决这个问题?

      论文提出了持久记忆投毒攻击 PMPA,通过两阶段工作流与三组件载荷设计,诱导智能体将外部恶意规则存入持久记忆并跨会话触发。

    4. 论文做了哪些实验?

      论文在两个智能体和三个模型上测得平均 ISR 达 66.9%–73.7%,跨会话 C-ASR 达 55.5%–81.7%,且防御对已写入记忆防护有限。

    5. 有什么可以进一步探索的点?

      作者计划未来在更广泛设置与更多模型上评估该攻击,并探索针对持久记忆投毒更有效的防御手段。

    6. 总结一下论文的主要内容

      论文提出了持久记忆投毒攻击 PMPA,报告了 harness 智能体在处理外部数据时易受跨会话记忆投毒与隐私泄露的风险。

    完整解读
  15. 攻击arXiv:2609.36941 · 53

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    作者通过扰动蒸馏本地代理与离线过滤提取黑盒大模型凭据,真实key平均恢复数较直接查询提升11.8%–25.0%(Table 1)。

    • 25.0%DeepSeek-Coder-7B上RS均值较基线提升(Table 1)
    • 11.8%LLaMA-3-8B上RS均值较直接查询基线提升(Table 1)
    • 2.6×弱扰动下真实凭据比例RR较DESEC最大提升(Table 2)
    6 问速览针对商业大模型仅有输出访问权限且缺乏原始上下文的限制,解决代码模型记忆的高熵 API key 提取与防幻觉问题。
    1. 这篇论文试图解决什么问题?

      针对商业大模型仅有输出访问权限且缺乏原始上下文的限制,解决代码模型记忆的高熵 API key 提取与防幻觉问题。

    2. 有哪些相关研究?

      现有工作包括基于代码补全的 HCR、白盒概率引导的 DESEC 及 PII 提取,但均未解决黑盒高熵凭据定向提取。

    3. 论文如何解决这个问题?

      通过 5 种代码前缀扰动与硬标签蒸馏构建本地白盒代理,再通过离线截断采样与局部熵及 4-gram 重复抑制筛选真凭据。

    4. 论文做了哪些实验?

      在 3 个受害模型上真实凭据恢复数提升 11.8%–25.0%,延迟降 20.7–34.8 倍,并从 3 个商业模型中提取出真实凭据。

    5. 有什么可以进一步探索的点?

      作者计划未来开源代码并呼吁更严格的数据清洗,实测未向外部接口发送实时请求;受控实验覆盖 3 个受害模型与 5 家凭据。

    6. 总结一下论文的主要内容

      论文提出扰动蒸馏与离线过滤两阶段框架,实现了 output-only 访问下延迟降低的黑盒大模型 API key 提取。

    完整解读
  16. 攻击arXiv:2609.33985 · 55

    研究:众包微调数据投毒可放大专有指令抽取

    注入50条主题中毒样本使Qwen2.5-14B在OpenMathInstruct上近原样提取率达良性微调的3.71倍。

    • 8.84%Qwen2.5-14B在OpenMathInstruct上50条中毒样本的近原样提取率
    • 3.71×Qwen2.5-14B在OpenMathInstruct上50条中毒样本相对良性微调的提取倍率
    • 6.07%Llama-3.1-8B在AceReason上100条中毒样本的直接提交近原样提取率
    6 问速览研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。
    1. 这篇论文试图解决什么问题?

      研究在黑盒输出设定下,能否通过向众包微调数据注入少量中毒样本放大提取其他用户的未知指令。

    2. 有哪些相关研究?

      涵盖预训练与微调数据提取、众包微调数据集构建,以及基于数据中毒的隐私推断与数据窃取攻击。

    3. 论文如何解决这个问题?

      构建领域主题锚点注入提取引导样本,并利用未微调代理模型的不确定性自适应筛选高收益锚点进行查询。

    4. 论文做了哪些实验?

      在 4 个模型与 2 个数据集上评估了直接提交与托管交互中毒,并测试了 4 种防御过滤方法及模型蒸馏效用。

    5. 有什么可以进一步探索的点?

      论文未专门讨论局限,其实验覆盖了 4 个开源模型、2 个核心数据集、4 种异常检测方法与多种预算配置。

    6. 总结一下论文的主要内容

      论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    完整解读
已经到底了