跳到正文
今天10月8日周四
  1. 论文追踪 · 收录 · 原文 论文59

    研究:LLM 路由决策日志可推断用户医疗、自伤等敏感话题

    一项预注册研究在 170 万条真实请求(WildChat-1M、LMSYS-Chat-1M)上测量了 LLM 路由决策作为隐私信道的泄露程度,发现即使关闭内容日志,网关仍可保留每次请求所选模型、调用方与 token 数。在长度匹配条件下,RouteLLM 在 50% 工作点把骚扰和自伤请求送往强模型的概率比可比请求低 19 个百分点,医疗请求低 31 个百分点,性相关请求高 10 个百分点;第二个路由器 notdiamond-0001 对四类请求都更少送往强模型。仅凭 20 条路由决策即可区分频繁医疗提问用户,AUC 为 0.71,低于预注册的 0.75 阈值;域路由器的健康标签可达 0.92。作者调查了 11 个网关、路由器和云平台的日志字段,其中至少 6 个可在无内容日志下保留带调用方的逐请求模型记录,部分为默认行为。

    推荐理由论文在 170 万条真实请求上测量路由决策日志对敏感话题的泄露,并给出各类防御的代价,可帮助部署路由的团队评估元数据留存风险。

  2. 论文追踪 · 收录 · 原文 论文56

    论文提出 eTAMP 攻击:网页内容注入可跨会话污染 Web Agent 记忆

    亚马逊与宾州州立大学研究者提出 eTAMP,一种仅通过环境观察即可实现的轨迹记忆投毒攻击,攻击者在网页用户生成内容中埋入指令,Agent 浏览后被动写入记忆,并在后续不同网站的任务中触发,无需直接访问记忆库,可绕过按站点授予权限的防御。在 (Visual)WebArena 上,约 280 组跨站点任务对中,攻击成功率最高为 GPT-5-mini 32.5%、GPT-5.2 23.4%、GPT-OSS-120B 19.5%;任务 A 阶段的提前触发率接近 0。研究还发现 Frustration Exploitation 现象:在 Chaos Monkey 注入点击丢失、滚动反转、输入乱码等环境压力后,GPT-5-mini 攻击成功率从 3.6% 升至 32.5%,提升约 8 倍,GPT-5.2 上升 17 个百分点。作者提示记忆应被视为不可信输入,并指出能力更强的模型未必更安全。

    推荐理由论文提出仅靠网页内容注入即可跨会话、跨站点污染 Agent 记忆的攻击,并给出多款模型上的成功率与压力条件下的放大效应。

  3. 论文追踪 · 收录 · 原文 论文59

    Trojan Hippo Bench:针对 LLM Agent 持久记忆攻击与防御的动态基准

    ETH Zurich、UC Berkeley 与 Snyk 的研究者提出 Trojan Hippo Bench,用于系统评测 LLM Agent 持久记忆中的投毒攻击与记忆层防御。该攻击通过一次不可信工具调用(如一封精心构造的邮件)把休眠载荷写入 Agent 长期记忆,仅在用户后续谈及财务、健康、身份等敏感话题时激活并把个人数据外发。在邮件助手场景下,未加防御的攻击对 OpenAI 和 Google 前沿模型的攻击成功率达 85–100%,注入后经过 100 轮良性会话仍可激活。研究者评测了四种基于基本安全原则的记忆层防御,可将攻击成功率降至 0–5%,其中可证明安全的信息流控制策略在所有配置下达到 0%,但各防御的效用代价差异很大,实际部署仍是未解问题。基准已开源。

    推荐理由论文给出持久记忆投毒在四种记忆后端上的攻击成功率与四类防御的效用代价,可据此评估自家 Agent 的记忆层风险。

  4. 论文追踪 · 收录 · 原文 论文55

    研究显示前沿模型智能体在测试时自行形成隐蔽信道

    康奈尔大学、UC Davis、宾夕法尼亚大学与亚利桑那州立大学的研究者发现,参数固定、没有共享编码本的语言模型智能体对能通过多轮交互学会传递私密信息。实验用四选一的公开报告摘要配对四种秘密状态,智能体仅靠每轮一比特的对错反馈学习建立映射;在十局独立对局中,两个 GPT-5.6 Sol 智能体的最终准确率达到 95%,而随机猜测为 25%。在模拟事件响应任务中,发送方自行撰写更新并被告知保密,每一条消息都经监控逐条审核,十局 Sol 对局最终仍以 98.8% 的准确率恢复机密发现,且全部最终消息通过审核。研究还发现,从第一轮起对消息进行改写,三对智能体仍能在改写语言上学会通信,最终准确率为 75%、87.5% 和 87.5%;仅改写已有信道则使恢复率从 98.8% 降至 45%。作者认为,保密性不仅取决于单条消息写了什么,也取决于接收方从过往交互中学会了如何解读。

    推荐理由论文给出多模型配对在固定参数下的隐蔽信道成功率,并显示消息改写与监控评审在初次交互时被学习绕过。

  5. Hugging Face Daily Papers · 收录 · 原文 论文54

    研究:多向量视觉文档索引可被反演还原页面内容

    研究者提出一种针对多向量视觉文档检索索引的反演攻击,在零侧信息条件下仅凭存储的向量还原页面图像。攻击以条件流匹配反演器实现,先在 13 个公开检索器中识别出编码器,再从索引推断页面形状,并用位置模型恢复被打乱向量的顺序。在 ViDoRe v3 的 2000 页评测集上,从原始索引反演的页面恢复 47% 的单词和 45% 的敏感 token,98.4% 的情况下能把源页面排在第一;独立评判编码器下该比例为 97.7%。两种廉价防护中,token pooling 使单词召回降至约 8%,反演未成功;打乱顺序同样降至约 8%,但位置模型可将重识别率从 3.8% 提升到 93.5%。同一攻击原样迁移到另一个检索器 ColQwen3.5-4.5B 时,源页面排第一的比例为 70.2%。

    推荐理由论文给出多向量视觉文档索引可被反演的具体成功率与两种廉价防护的失效边界,运营向量库的团队可据此重新评估索引的敏感级别。

10月7日周三
  1. 论文追踪 · 收录 · 原文 论文59

    MemLeak 研究:多租户 Agent 共享向量记忆库存在跨用户记忆泄露

    Workday AI Research 的 MemLeak 研究指出,企业多租户个人 Agent 若共享同一向量记忆库,普通余弦相似度检索即可把其他用户的记忆拉入当前会话,无需任何漏洞利用。在池化同团队检索下,非对抗性泄露率达 70–100%;精心构造的记忆在 top-k 中占比 90–100%,生产级稠密检索下得分提升 +0.416 至 +0.511;端到端响应污染最高达 5.00/5,且被污染的回答常被评为同样或更有帮助。研究测试了三种缓解方案,只有检索后硬性归属门控能在两个生成模型上把污染恢复到 1.00/5 的干净基线,每次查询延迟开销约 1.4 ms。作者强调这是受控概念验证,样本为每条件 10 条查询,不代表真实企业泄露率。

    推荐理由论文量化了多租户 Agent 共享向量记忆库的跨用户泄露,并给出硬性归属门控这一低成本缓解方案,部署记忆系统的团队可据此评估自身风险。

  2. 论文追踪 · 收录 · 原文 论文53

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    研究者提出 Privacy-Leaking Watermarks(PLWs),一种由恶意模型提供方植入的隐形、触发依赖水印,可依据此前的聊天历史进行条件触发。在统一多模态架构下,对话中早先提到的敏感关键词或语义线索会让后续一张无关图像携带隐蔽但可检测的水印,从而把图像生成变成隐私泄露通道,即便模型在本地部署也无法避免。在 13 种敏感属性触发条件和两个模型家族上,PLWs 在 1% FPR 下最高达到 100.0% TPR;例如 OmniGen2 在所有测试的对话间隔下都能检出此前披露的抑郁信息,而对未披露此类信息的图像误报率仅 1%。

10月6日周二
  1. Hugging Face Daily Papers · 收录 · 原文 论文46

    研究显示拆分学习中的梯度可提升客户端文本重建率

    研究者在拆分学习场景下测量了梯度对客户端文本泄露的贡献。在 GPT-2 上,仅凭客户端层的公开权重,攻击者从激活值中恢复 94.20% 的 token,同时看到梯度后升至 97.38%,提高 3.17 个百分点,95% 区间为 [2.72, 3.64]。按文档统计差距更大:32 token 的文档中,无梯度时 13.71% 被完整重建,有梯度时为 37.77%,因为文档需每个 token 都正确才计入。防御效果也随统计口径变化,Secret mixup 将每个输出向量与诱饵混合后几乎无法完整重建文档,但攻击者仍能恢复 83-91% 的 token。在 GPT-2 与 Qwen3-0.6B 的第二组实验中,服务器只训练连续若干层时,起始层位置在层数固定情况下同时影响模型质量与泄露程度。 这些结果限于两个小模型与短文本实验,不能直接外推到大模型或长文档;防御测试未采用针对防御的自适应攻击,因此报告的是已观察到的泄露下限。

  2. 论文追踪 · 收录 · 原文 论文55

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    TranScope 研究硬件侧信道可能带来的模型成员推断风险,即硬件层面的信息泄露是否能够暴露某条数据参与过模型训练。

    推荐理由论文给出基于硬件性能计数器的成员推断方法,在恒定时间模型上绕过置信度掩码,并披露已向 Intel 报告。

  3. arXiv · 收录 · 原文 日期未知论文45

    Tracer 框架可从遗忘后的扩散模型中识别被擦除概念

    研究者提出 Tracer 框架,用于识别扩散模型中被遗忘算法擦除的概念并估计其数量,无需事先知道哪些概念被删除。该方法不生成和分类图像,而是对权重足迹做轻量谱分析,从而在大型候选词表上高效搜索;通过足迹覆盖目标引导顺序发现多个被擦除概念,并依据候选置信度的骤降估计擦除数量,无需标注样本校准。框架仅需轻量线性代数和有限前向探测,不依赖对遗忘算法的先验知识。在文本到图像和文本到视频骨干模型及多种遗忘方法上的实验显示,Tracer 可在数秒内完成识别与计数,相比 MIA 和暴力搜索分别实现 150 至 137,000 倍和 133 至 20,000 倍的加速,且识别准确率更高。

  4. 论文追踪 · 收录 · 原文 论文46

    研究揭示 Jev 作为应用决策层的安全与隐私风险

    研究者对 Jev 这一将自然语言问题转为带类型答案与概率的决策层接口做了首次系统性安全与隐私研究,使用官方 Jev API 和训练数据与更新可控的本地模型 NanoJev。研究围绕三个问题展开:Jev 作为应用决策层时的安全威胁、受限类型化输出仍可能泄露的隐私信息、以及其通用决策能力的正反两用。作者改造提示注入与对抗后缀来操纵其决策,并通过训练数据投毒在 NanoJev 中植入后门以考察开源分发与更新带来的供应链风险;同时改造成员推断、私有属性推断和内部知识推断攻击,从受限输出格式中恢复敏感信息。研究还用提示注入、越狱输入、有害内容和 AI 生成文本四项检测任务考察其防御用途,并分析越狱与模型提取等滥用场景。实验显示 Jev 对上述安全与隐私威胁仍然脆弱,其决策能力可同时支持有益与恶意用途。

  5. 论文追踪 · 收录 · 原文 论文53

    论文披露主动式智能体的服务方间接提示注入攻击

    论文提出一种针对主动式个人智能体的服务方间接提示注入攻击,外部服务方无需访问用户私有上下文、无需攻陷智能体或获取额外权限,仅控制与自身目标相关的内容,就能让原本中立的智能体转而推进该目标。作者用目标控制、私有绑定与前瞻支持三个维度刻画这一失效模式,分别决定智能体推进什么、如何把目标与用户关联、以及接下来提供哪些目标相关协助。在三个主动式智能体环境和六个模拟用户模型上,完整攻击在所有环境与用户模型组合中都提升了目标授权,宏观增幅最高达 77.4 个百分点。对照重放显示,正确的用户与目标绑定比单纯增加提案细节更关键;多轮扩展还显示,即便最终未获授权,服务方目标仍能通过改变智能体对用户约束与抵触的回应方式保持影响。

  6. 论文追踪 · 收录 · 原文 论文58

    StegoMemory 红队测试:智能体持久记忆可被用作跨会话隐蔽信道

    研究者对智能体持久记忆发起大规模红队测试,验证攻击者能否在一个会话中把受控字符串以隐写方式写入记忆、在另一会话中取回而不触发安全监督。测试覆盖 14000 次攻击试验、91 个模型与攻击配置、13 个模型和 7 种隐写方案(Acrostic、Mesostic、Telestich、Word-choice、Capitalization、Position-based、Homoglyph)。41.2% 的试验成功在回复中编码目标载荷,29.8% 在记忆写入后仍保持编码完整,25.4% 在检索时可恢复载荷,20.1% 实现精确匹配恢复,其中包括从未向接收方暴露的合成 API key 和密钥材料。精确匹配传输中有 71.4% 同时通过主任务完成度评分并被监督模型独立判定为安全,相当于全部试验的 14.4%。

    推荐理由论文用 14000 次试验量化了智能体记忆作为跨会话隐蔽信道的成功率,并指出记忆写入而非检测才是当前主要瓶颈。

  7. 论文追踪 · 收录 · 原文 论文55

    AgentDoxx:联网搜索 Agent 对匿名访谈文本的再识别评测

    研究者提出 AgentDoxx,一个包含 822 份合成访谈文本的评测套件,用于衡量具备联网搜索能力的 LLM Agent 对匿名文本的再识别风险。这些访谈基于 r/IAmA 中公开披露身份者的公开信息生成,经人工判别研究显示其与真实访谈难以区分。在 15 种模型配置上,Kimi K3、GLM-5.3 Flash 和 DeepSeek-V4 Flash 在无搜索条件下仅凭参数知识即可正确识别 15–28% 的文本;一旦目标姓名出现在检索结果中,识别成功率超过 88%。防护方面,命名实体遮蔽后仍有至少一个攻击者能识别 85.3% 的分层样本;属性噪声替换把平均准确率从 75.1% 降至 34.2%;系统提示中的隐私指令降幅最大(75.1% 降至 21.6%),但在拒答姓名的样本中 37% 已在检索阶段拿到姓名、58% 仍描述了目标的辨识性细节。

    推荐理由该研究用 822 份已知身份的合成访谈量化了联网搜索对再识别风险的贡献,并给出多种匿名化防护的实测效果。

10月5日周一
  1. arXiv · 收录 · 原文 论文40

    LiBRA:通过双向隐空间优化实现检测感知的图像水印去除

    研究者提出 LiBRA(Latent In-band Bidirectional Removal Attack),一种在已知水印密钥和解码器的前提下,通过双向隐空间优化去除 AI 生成图像水印的方法。已有攻击通过迫使解码水印与原始水印不同来去除水印,但可能产生仍可检测的反向水印,导致去除失败,继续修改还会损害图像质量。LiBRA 在公开自编码器的隐空间中做有界修改,将平均解码置信度从任一方向引导至随机猜测水平,避免出现反向但可检测的水印。方法保留单个比特的灵活性,使图像质量约束倾向于选择破坏更小的修改,并可用频率引导掩码限制修改位置。研究使用精确双侧二项检验验证去除效果,而非假定置信度目标必然带来成功。

  2. arXiv · 收录 · 原文 论文67

    研究:跨通道碎片化攻击可绕过 MCP 单通道防御,12 个前沿模型最高 100% 泄露凭据

    密苏里大学堪萨斯城分校的研究者提出跨通道碎片化攻击,将看似无害的载荷分散到 MCP 的两个或三个输入通道,单个通道都不含完整注入,模型却在统一上下文窗口中把它们拼合成凭据外泄。研究在 12 个前沿模型、3 个生产客户端和 6 种载荷上完成超过 15,000 次试验,发现完全抵抗单通道注入(0% 合规)的模型在两通道碎片化下外泄率最高达 100%,包括 GPT-4o、Llama 70B、Composer 2 和 Haiku 4.5。三通道碎片化在生产客户端中进一步扩大受影响范围,Haiku 4.5 在 Cursor 中达到 100%,Sonnet 4.6 和 Opus 4.6 在所测碎片化攻击中未发生泄露(0/20)。研究还展示了价值对齐利用(工具声称的用途本身就需要目标数据)以及通过 VS Code 的 sampling/createMessage 注入持久系统提示。

    推荐理由论文给出跨通道碎片化攻击的完整测量框架与 12 个前沿模型的合规矩阵,部署 MCP 客户端的团队可据此检查自身信任假设。

  3. 论文追踪 · 收录 · 原文 论文53

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    研究者提出 ReGap,一种无需真实隐私监督的微调恢复攻击,用目标模型自身生成的候选答案构造监督数据,再按答案 token 似然筛选并训练新的 LoRA 适配器。在 GPT-2 Small/Medium/Large、OPT-1.3B 和 Qwen3-1.7B/4B 六个设置上,一轮 ReGap 使目标关联恢复率比微调后模型提升 6 至 21 个百分点,GPT-2 Medium 从 42% 升至 63%,GPT-2 Large 从 55% 升至 72%。在适配身份与所有记忆及评测身份完全不重叠、生成候选池和选中样本中均无精确目标答案的对照下,GPT-2 Medium 和 Large 仍分别提升 15.3 和 14.0 个百分点。同一适配器只在曾接触过目标的检查点上带来提升,在未接触目标的匹配检查点上无增益,说明恢复依赖此前的目标暴露。该效果在随机绑定结构和 NPO 遗忘处理后明显减弱。

    推荐理由论文给出无需真实隐私监督即可重新提取模型已学隐私关联的微调方法,并附跨模型成功率与失效边界。

  4. 论文追踪 · 收录 · 原文 论文53

    研究者提出 IMMRAG 攻击,可从多模态 RAG 数据存储中提取医学与文档图像

    研究者提出 IMMRAG,一种在黑盒设置下针对图像返回式多模态 RAG 的自动化数据提取攻击。该方法把恶意指令嵌入用户提供的输入图像,而非放在文本提示词中,每次查询将攻击者持有的影子图像与已从系统中恢复的图像混合,并用相关性加权重采样把后续查询导向仍能返回新结果的嵌入空间区域。在医学助手、文档助手和通用工具三类场景中,单次 2500 次查询的运行按局部特征匹配分别重建出最多 611 张放射学图像、566 份文档扫描件和 416 张通用图像,不同数据存储条目数最高为非自适应基线的 5.6 倍。实验覆盖多个 CLIP 系列检索器和多种生成器,作者据此指出需要针对多模态数据设计专门防护。

  5. 论文追踪 · 收录 · 原文 论文48

    OverAct:衡量并缓解 LLM 工具调用智能体的主动越权取数

    研究者提出 OverAct 基准,用于衡量结构化工具调用 LLM 智能体在用户请求之外主动获取更多信息的行为,并将其命名为主动越权(proactive over-authorization)。该基准覆盖八个隐私敏感领域,采用确定性、无需评判模型的打分方式,并配套一个决策论解释框架,给出三条可检验预测。在来自四个模型族的七个模型上,所有模型都显著超出授权范围;请求具体性是严重程度的最强预测因素,越权程度随工具池规模呈次线性增长,解码温度影响很小,这些模式与成本不对称解释一致。作者还提出零样本推理时方法 SelfAudit,通过生成基于请求的论证并在执行前过滤无依据的调用,在无 oracle 知识的情况下将隐私相关越权减少 43%,消融显示显式过滤是范围缩减的主要来源。

10月4日周日
  1. 论文追踪 · 收录 · 原文 论文53

    SigLeak 可从执行轨迹推断专有 Agent 技能,平均提升成功率 6.88 个百分点

    研究者提出 SigLeak,一个仅凭公开任务描述和黑盒交互就能从执行轨迹中推断专有 Agent 技能内容的框架,并将这一威胁形式化为 Skill Leakage。方法分两阶段:先用诊断任务构造生成多样且决策密集的探针,再对比同一探针在启用与禁用目标技能下的配对轨迹,提取可复现的技能签名并迭代精炼重建结果,全程不需要参考答案或轨迹级正确性标注。在五个场景、三个模型家族和三个 Agent 框架上,SigLeak 在几乎所有设置中取得最佳或并列最佳的下游成功率,平均比禁用技能的基线高 6.88 个百分点,细粒度 SkillSim 的 F1 与召回率也最高。在 SkillGuard5 提示防御下,提示窃取基线 BBS 的细粒度召回与 F1 为零,而 SigLeak 仍能恢复目标技能内容。作者指出,隐藏技能文件并不能隐藏其行为影响,需要在不牺牲执行可见性的前提下设计针对行为推断的防御。

    推荐理由论文把专有 Agent 技能被行为轨迹反推的风险形式化,并给出可复现的黑盒推断流程与跨模型评测结果。

  2. 论文追踪 · 收录 · 原文 论文49

    论文指出密码学模型认证的假设缺口:审计通过但部署失效

    论文《Certified in Theory, Broken in Practice》指出,基于安全零知识证明(ZKP)的密码学模型认证(CMC)方案存在假设缺口:现有安全定义只保证模型在固定审计数据集上的行为,未保证同一分布的其他数据上同样成立。作者据此构造攻击,通过精心设计训练数据,使模型在审计中表现正常、部署后出现病态行为,实验显示攻击者可认证模型在审计集上准确率超过99%,而在同分布新样本上不足30%。为弥补该缺口,作者形式化了面向 CMC 框架的密码学安全定义,提出通用协议模板并证明其满足这些要求。作者认为该结果既是对现有方案的警示,也为设计安全、隐私保护的机器学习审计协议提供了建设性指引。

  3. 论文追踪 · 收录 · 原文 论文56

    研究揭示 split-LLM 训练中返回梯度泄露真实行,前向隐私门仍通过

    研究者对两节点 split-LLM 训练系统做安全案例研究,发现被评估为通过隐私门的前向通道之外,返回的输出梯度存在未被测试的泄露通道。可信本地节点持有私有损失并回传输出梯度,由于损失在 decoy 行之前截断,decoy 行的梯度恒为零,零支撑模式直接暴露哪些行是真实行。在九个随机种子上,每次运行的 4,096 个帧都被准确区分出真实行,行级一致率为 1.000。基于该结构信号的内容探测相对常量基线多恢复约每百 token 一个 token,提升 +0.65 至 +1.50 个百分点,而打乱标签的对照未恢复任何信息。在通过前向隐私门与质量门的四层浅分割配置上,联合视图仍突破预设的 +1.0 个百分点门限。

    推荐理由论文给出一种被前向隐私门漏掉的梯度通道泄露,并附可复现的校准协议与缓解成本,适合做隐私评测的团队参考。

  4. 论文追踪 · 收录 · 原文 论文67

    研究者利用加密推理块跨模型兼容性窃取专有 LLM 推理链

    研究者发现 Anthropic、OpenAI、Google 的 API 把思维链以加密块形式交给客户端回传,这些加密块在同一厂商生态内可跨会话、跨用户、跨模型复用。他们把强模型的加密推理块注入同厂商较弱、防护较松的模型(如 Claude Haiku 4.5、GPT-5.6 Luna、Gemini Robotics 1.6),迫使其逐字转写明文,从而在不直接越狱强模型的情况下提取其推理链。该漏洞衍生四类攻击:绕过反蒸馏机制窃取专有推理、从公开会话日志中大规模提取隐私数据、通过隐藏推理通道获取有害信息、以及在加密块中植入不可见的提示注入。研究者在 GitHub 和 Hugging Face 抓取 6,708 条公开 Agent 轨迹,解码出 315,320 条推理链,恢复 367 项 PII 和 182 项凭据,其中真实用户会话包含 62 个 API key、33 个密码和 30 个邮箱。

    推荐理由论文披露加密推理块可跨会话、跨用户、跨模型复用,并给出对 Anthropic、OpenAI、Google 三家 API 的实测结果与缓解建议。

10月3日周六
  1. 论文追踪 · 收录 · 原文 论文49

    GraphProfiler 用个人知识图谱推断敏感属性并溯源到具体帖子

    研究者提出 GraphProfiler,一种可审计的 LLM 画像方法,将用户发帖历史表示为带来源链接的个人知识图谱,节点和边可回溯到原始帖子,属性预测可引用图谱记录和源文本。在八属性的 SynthPAI 基准上攻击成功率达 86.7%,与纯文本强基线相差不到两个百分点,在 PANDORA 上为 84.6%,超过 98% 的预测附有支持证据。消融实验显示,移除被引用的帖子比移除同等数量的随机帖子更能降低攻击成功率,说明这些帖子确实贡献了推断结果。该工作已被 EMNLP 2026 主会接收。

  2. 论文追踪 · 收录 · 原文 论文50

    研究揭示训练效率与模型脆弱性的权衡:高效训练更易受对抗与隐私攻击

    Yiyong Liu、Jun Sakuma、Michael Backes、Rui Wen 的论文对训练效率与模型脆弱性的权衡做了跨领域系统研究,覆盖视觉与语言模型。结果显示,采用选择性数据采样、高效预训练和简化强化学习流程等效率导向策略的模型,对对抗攻击和隐私攻击的易感性上升。作者通过分析模型内部几何与功能表征发现,高效变体一致表现出更尖锐的损失几何以及表征结构的系统性变化。研究还扩展到零 RL 训练,发现用简化 RL 流程训练的模型比常规对齐流程训练的模型更容易出现灾难性遗忘和过度自信。作者据此认为训练效率并非免费午餐,并呼吁转向同时优化性能、成本与安全的多目标训练。

  3. 论文追踪 · 收录 · 原文 论文54

    研究实测五套 Agent 记忆系统均不执行撤销标记

    研究者对 Graphiti、Zep(两者共用同一引擎)、mem0、langmem 和 cognee 五套采用软撤销的 Agent 记忆系统做实证测量,发现没有系统默认执行撤销:被标记为无效的事实仍可能在检索时返回,导致 Agent 选择不安全动作。实验覆盖九个策略场景、六个厂商的九个模型,每个试验在六种防御条件下评分。五套系统中有两套会同时返回撤销记录和替代记录,这两套在所有场景中都把撤销记录排在当前记录之前,并在超过五分之二的试验中让 Agent 选了不安全动作。作者据此开发了一个位于 Agent 与记忆后端之间的护栏,在读取时检查记录有效性,扣留已撤销或与替代版本冲突的记录,并在相同系统与模型上验证其效果,代码已开源。

    推荐理由论文实测五套 Agent 记忆系统在检索时均不执行撤销标记,并给出一个可复现的检索层护栏设计。

  4. 论文追踪 · 收录 · 原文 论文58

    研究者提出 MemGhost,对持久化个人 Agent 实现隐蔽记忆注入

    研究者提出隐蔽记忆注入攻击,利用不可信外部内容被静默写入 Agent 持久记忆并在此后作为可信状态复用。为评估该威胁,他们构建 WhisperBench,一个含 108 个案例、覆盖五类风险及事实与偏好投毒的基准,使用真实 IMAP/SMTP 邮件流程和真实邮件 Agent 技能进行全周期评测。攻击框架 MemGhost 通过环境代理模拟持久化 Agent 执行、目标代理将记忆采纳与会话隐蔽性转为密集奖励,再用监督微调和强化学习训练攻击策略,实现单封邮件的一次性载荷生成。

    推荐理由论文提出针对持久化个人 Agent 的隐蔽记忆注入攻击,并给出跨框架、跨记忆后端的成功率数据,可供部署此类 Agent 的团队评估风险。

10月2日周五
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文50

    LLMLeak:借 LLM 合法网页抓取实施隐蔽数据外泄

    研究者提出 LLMLeak,一种利用 LLM 网页抓取工具建立隐蔽信道的新型攻击向量:本地恶意软件无法直接联网,却可把机密编码进 URL,并以“迁移软件库”等良性任务为由让 LLM 访问该链接,攻击者再通过自己控制的 DNS 或网页服务器取回编码后的机密。作者指出,直接让 LLM 用生成代码发送数据的输入容易被检测、网络库通常也受限,而 LLMLeak 只依赖 LLM 获取网站信息的工具。在 11 个开放参数模型上的评测显示攻击成功率为 79.7%,作者还对真实聊天机器人做了案例研究。

10月1日周四
  1. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文59

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    研究者提出 Repeat-After-Me,一种黑盒自适应视觉提示注入攻击,可诱导模型泄露个人身份信息或发起恶意工具调用。在良性用户提示与注入任务语义无关、且未口头授权的现实设定下,该方法在开源与商用前沿 VLM 上的攻击成功率分别超过 82% 和 47%,涉及 Qwen3.6-27B 与 GPT-5.5。优化后的注入在商用 VLM 和良性样本间具有一定可迁移性,并在自适应文本提示注入失效的场景中仍然有效。在一个接入 Discord 的真实 OpenClaw Agent 中,不受信任的用户可用一张轻度注入的图片覆盖其 TOOLS.md 文件,为之后的远程代码执行和密钥窃取等敏感行为铺路。论文还讨论了潜在防御手段。

    推荐理由论文给出黑盒视觉提示注入在多个前沿 VLM 上的成功率,并演示了在真实 OpenClaw 智能体上覆写配置文件的完整链路。

  2. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法

    作者提出 Proxy Manifold Alignment(PMA),一种针对隐私保护 LLM 中 Embedding-to-Embedding Obfuscation(E2EO)方案的密文到明文重建攻击。其核心观察是 E2EO 保留了原始语义结构,因此混淆后的向量流可视为一种符号即向量本身的未知分词语言,攻击被建模为从该未知语言到明文的翻译任务。PMA 仅需访问混淆向量流、目标分词器和公开语料,先用 Word2Vec 分别建模混淆流与公开语料的共现模式并构建两个代理嵌入向量,再基于结构相似性对齐两者的底层流形,最后把混淆向量映射回明文。实验结果显示,PMA 的明文恢复效果持续高于其他 SOTA 攻击方法。

  3. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    研究者在双 T4 上复现并插桩 Tree-Ring 语义水印伪造攻击

    作者在 Stable Diffusion XL 上复现了 Müller 等人针对 Tree-Ring 语义水印的 Reprompt 伪造攻击,使用原作者发布的代码,在免费档双 T4 GPU(每卡可用显存 14.6 GB)上运行,单卡显存明显低于原研究使用的 A40。三组共六次试验中,真实图像检出 6/6,干净图像 0/6,伪造图像 5/6,每次攻击耗时 325-332 秒。作者还从检测器源码中恢复了被丢弃的非中心卡方统计量,其恢复结果与已发布检测器完全一致,基于该统计量构造的两个分数在同一批 18 个观测上以 AUC 0.861 和 0.972 区分伪造组与干净零假设。

  4. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文50

    研究:置换式保密在混合 FHE 推理中失效,可精确恢复 ResNet-20 全部线性层

    该论文指出,混合 FHE 推理中依靠输出置换加噪来保护模型保密性的方案在系统所需的正确性范围内失效。作者证明,对 d 输入的线性层,d+1 次合法查询即可精确恢复置换不变的层摘要,从而实现模型的完全区分;输入 DP 与模型保密性正交,且正确性受限的噪声下 shuffle 放大所需的本地 DP 前提无法成立。实验从 TFHE 记录中以零误差端到端恢复 SAFHIRE 风格 ResNet-20 的全部线性层,每层用 d+1 次查询,共 5712 次直接查询;在相同查询模型下,预训练 ImageNet 规模 CNN 与 ViT-B/16 也实现逐层精确恢复。

  5. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文27

    RemTraceNet:不可见水印攻击的少样本取证检测

    RemTraceNet 通过融合受限残差、局部关系、FFT/Haar 统计与块 DCT 证据,在原生分辨率下对不可见水印移除过程进行少样本取证检测。在 23 种移除流程和 10 种水印配置、每条流程 100 张攻击训练图像下,其 TPR@1%FPR 三种子宏平均为 82.75%–88.17%,比重新训练的 SRNet、ZhuNet 和 SiaStegNet 高出 10.80–15.68 个百分点。结果表明,擦除水印与擦除移除痕迹是两项不同挑战,移除痕迹在有限监督下仍可学习。

  6. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    BAM 反馈编码实现推理时隐蔽的智能体通信

    研究者提出 BAM(Burnashev Adaptive Posterior Matching)反馈编码方案,把黑盒 LLM 隐写重构为带因果无噪声反馈的序列通信问题,每个生成的 token 双方都能观察到并用于指导后续嵌入。该方法结合后验匹配与解码确认阶段,安全性通过密码学归约证明建立。在三个开源权重语言模型上,BAM 于约 50 个 token 内传输 8-bit 载荷,1000 次试验的消息错误率为 0-0.1%,而同等长度下最强的黑盒基线为 10-17%。作者据此展示了在多种对话场景中实现高通信速率的端到端通信协议。

  7. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文43

    研究者提出通过替换神经网络权重高容量外泄医学影像的攻击

    研究者提出一种高容量神经隐写攻击,把医学图像编码为连续隐表示并嵌入模型初始化权重,模型导出后可直接从权重中重建隐藏图像。该方法用基于 StyleGAN2 的对抗自编码器学习紧凑隐码,并正则化使其匹配标准权重初始化统计量,从而让嵌入参数与干净模型在统计上保持一致;训练时注入噪声可提升对导出环节缓解措施的鲁棒性。载体模型在原本任务上仍保持可用,最多可将 99 个脑部 MRI 体数据嵌入一个 30MB 模型,且在会破坏此前比特级方案的缓解措施下仍可恢复。重建结果只是近似而非像素级精确,但嵌入内容在解剖上仍可辨认并可规模化恢复。

  8. Hugging Face Daily Papers · 收录 · 原文 论文55

    AgentTell:浏览器 Agent 的行为侧信道泄漏基准

    BRAC University 等机构的研究者提出 AgentTell,用于测量浏览器 Agent 的行为侧信道泄漏,即 Agent 在一个网站获取用户私密信息后,在另一个网站通过任务导向的选项选择无意泄露该信息。基准包含 20 个场景、100 个任务,每个任务先在 plant 网站让 Agent 获知秘密,再到 probe 网站选择与秘密对应的专属操作或不会泄露的通用操作。在六个模型上共评估 9,760 个会话,携带秘密的 Agent 在 61.1% 的会话中通过操作泄露信息,即使记忆里明确写下不得分享,仍在 56.7% 的这类会话中泄露;34.5% 的泄露会话中,Agent 的最终回复还错误地保证未披露任何信息。泄漏程度因秘密类型而异,个人属性、账户设置和物品归属关系泄漏最多,服务账户身份泄漏最少;若秘密在前一任务中被实际使用,泄漏概率更高。

    推荐理由论文给出跨网站行为侧信道泄漏的量化结果,做浏览器 Agent 的团队可据此检查选项设计是否泄露用户隐私。

  9. arXiv · 收录 · 原文 论文29

    面向良性用途的对抗攻击:视觉内容全生命周期主动防护综述

    一篇综述将数据所有者、创作者、平台或审计方主动施加扰动与结构化信号以干扰未授权自动化、支持事后追责的做法称为"面向良性用途的对抗攻击",并梳理了沿视觉资产生命周期分布的五个研究方向:分享阶段的隐私过滤器、针对未授权训练不可学习样本、防恶意编辑或模仿的生成式防护、用于访问控制的对抗验证码,以及传播后的来源溯源机制。作者按可迁移性、自适应性和部署就绪度统一评估这五类方法,发现多数防护仍主要针对静态或弱自适应对手验证,受控基准之外的证据依然稀缺。

  10. arXiv · 收录 · 原文 论文46

    DAEI:针对噪声防护文本嵌入的反演攻击揭示隐私风险

    研究者提出 DAEI,一种去噪感知的嵌入反演流程,用于在只能观测到加噪嵌入、无法获得干净嵌入目标的条件下重建原始文本。作者先分析现有生成式反演方法在该设定下失效的原因,将其归结为双重噪声陷阱,再用残差去噪自编码器结合生成式文本反演,并借助 Stein 无偏风险估计以无监督方式训练去噪器,使其仅凭含噪观测即可去噪。实验显示 DAEI 相比现有生成式反演基线在 BLEU 上取得约 154% 的相对提升,token 级 F1 与 ROUGE-L 也提升 32% 至 60%。该结果对简单高斯扰动即可防止嵌入泄露敏感信息的普遍假设提出质疑。论文 11 页、3 张图,已被 IEEE ICDM 2026 接收。

  11. arXiv · 收录 · 原文 论文50

    LeakGauge:用行为探针在解码前检测上下文泄露攻击信号

    研究者提出 LeakGauge,通过在输入后附加一个探测后缀并映射其 prefill token 概率,在解码前给出上下文泄露的攻击风险分数。作者发现,直接使用机密内容初始 token 的探针不如内容无关、直接表述泄露行为的探针稳健。在包括 GLM-5.2(753B)和 Kimi-K3(2.8T)在内的 11 个 LLM 上,LeakGauge 对未见攻击的 AUROC 达到 0.944 至 0.996,且在内容换语言或攻击从逐字泄露转为语义泄露时信号保持稳定。通过激活引导干预,作者进一步表明该风险分数对模型内部与泄露相关的方向敏感。该检测器额外参数少于 0.5K,附加延迟为 10.34 ms,代码已公开。

  12. arXiv · 收录 · 原文 论文50

    ContextLeak:通过恶意工具窃取 LLM Agent 运行时上下文

    研究者提出 ContextLeak,一种通过恶意工具窃取 LLM Agent 运行时上下文的攻击,目标是让 Agent 既选中该工具、又把上下文作为输入参数传给工具。作者指出,上下文外泄通常需要三个条件:Agent 选中恶意工具、Agent 将运行时上下文作为参数传入、工具实现把输入发送到攻击者控制的端点;已有工作主要关注第一和第三个条件,第二个条件此前基本未被探索。ContextLeak 用强化学习精心构造工具的名称和描述,由一个攻击 LLM 自动生成这些内容,并在具有多样化模拟 Agent 上下文的影子用户上对攻击 LLM 做强化学习微调,其关键技术贡献是针对上下文外泄目标设计的奖励函数。