跳到正文

第 4 页更新的内容回到最新

10月1日周四
  1. arXiv:后门、投毒与隐私 · 收录 · 原文 论文29

    用权重谱密度预测隐私泄露:WeightWatcher 谱指标可作为成员推理攻击脆弱性的代理

    研究发现,来自重尾自正则化框架的 WeightWatcher 谱指标可替代昂贵的影子模型,用于评估机器学习模型的成员推理攻击(MIA)风险。在图像与表格分类任务上,stable rank 与整体 MIA 成功率呈强正相关,Log alpha-Norm 在低假阳性区间与 MIA 脆弱性持续负相关,且这两种关联均强于泛化差距所给出的结果。这表明神经网络谱中包含过拟合常规指标未能捕捉的隐私泄露信息,为可扩展的隐私审计提供了新方向。

  2. arXiv:后门、投毒与隐私 · 收录 · 原文 论文29

    PL-MIA:基于成对似然比的成员推理攻击

    研究者提出 Pairwise Likelihood MIA(PL-MIA),将高斯似然比(GLR)统计量与总体校准、Cauchy 组合检验结合,用于审计机器学习模型的成员隐私风险。该方法对查询点与未参与训练的参考点做成对比较得到 p 值,再用 Cauchy 组合检验聚合连续信号,保留被二值投票丢弃的证据强度。实验显示,在低假阳性关键区间,PL-MIA 的真阳性率(TPR)较强基线提升超过 25%。

  3. arXiv:后门、投毒与隐私 · 收录 · 原文 论文16

    基于 Hessian 分析的相关性引导快速机器遗忘

    一种面向网络与分布式安全系统的机器遗忘框架通过识别训练集中的相关数据点并应用闭式参数更新规则,相比标准影响函数遗忘实现 82 倍墙钟加速,准确率较 SOTA 基线提升 10^-2。该方法借助 Hessian 阻尼保证数值稳定性,在包括 CIFAR-100 与 ResNet-50 在内的七种数据集-架构组合上评估,成员推理攻击成功率为 0.660,tug-of-war 得分为 0.950。

  4. arXiv:后门、投毒与隐私 · 收录 · 原文 论文50

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    论文提出 CIG-MIA,一种基于上下文信息增益的成员推断攻击,用于判断某文档是否属于 RAG 系统的知识库,覆盖灰盒与纯文本黑盒两种访问设定。其思路是显式注入候选文档对成员与非成员影响不同:文档已可通过检索获得时注入带来的额外支持很小,文档不在库中时注入引入新证据、似然增益更大。灰盒设定下直接由 token 级似然计算该增益,黑盒设定下用轻量代理估计器结合语义相似度与精确匹配特征,从生成文本中估计同一增益。

  5. arXiv:后门、投毒与隐私 · 收录 · 原文 论文38

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    作者提出 QPriv-VL,一个面向联邦学习、拆分学习和 U 型拆分学习的问题引导隐私感知 token 裁剪框架,在传输前按任务效用与隐私敏感度裁剪视觉 token。其核心是轻量级 Dynamic Threshold Predictor(DTP),在一次前向中同时估计样本级裁剪比例和 token 级保留掩码,结合视觉 patch 与问题嵌入的跨模态相似度,以及来自冻结 DINOv2 特征的敏感度信号,无需敏感度标签即可抑制潜在敏感区域。

  6. arXiv:Agent 与 MCP 安全 · 收录 · 原文 论文25

    可信智能体 AI:基于 LLM 的自主系统失效模式、缓解策略与 TADL 生命周期框架

    一篇 arXiv 综述梳理了基于大语言模型的智能体 AI 在安全与运维上的五类可信维度:安全与鲁棒性、对齐与人类监督、透明度与可审计性、隐私与数据治理、监管合规。文章把间接提示注入、后门触发、目标泛化错误、记忆污染和跨会话数据泄露等失效模式归入统一分类,并评估指令层级、上下文隔离、spotlighting、过程监督、受限工具使用和隐私保护记忆等缓解手段,区分有实证支持与仍属概念性的方法。作者据此提出六阶段 Trustworthy Agent Development Lifecycle(TADL),覆盖规格、设计、训练、评估、部署与监控,但该框架尚未经实证验证。

  7. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文27

    透过人眼与机器眼:理解视频透视扩展现实中的视图错配

    视频透视扩展现实(VST XR)系统常以头显截图作为用户第一人称视觉上下文的代理,但系统捕获的矩形画面与用户实际可见的非矩形区域并不一致。研究在 Meta Quest 3 上开展试点级边界测量,证实截图帧与近似人类可见边界存在明显错配,并形式化了共见、仅系统可见与仅人类可见三类区域。基于该模型,四项案例研究显示视图错配可引发提示注入、隐私泄露、人类不可见信息偏差及人类可见信息缺失等风险,说明这不仅是几何问题,也带来安全、隐私与可靠性隐患。

  8. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文46

    PrivDrift:审计活跃 LLM 对话中话题漂移下的用户秘密泄露

    研究者提出 PrivDrift 基准,用于审计用户披露的秘密在对话话题漂移和说服式探测后是否仍可被恢复。该基准包含 1000 组受控多轮对话,设有植入秘密、内容密集的漂移轮次和标准化提取探测。在三个具备扩展上下文窗口的 LLM 上,对话级混合泄露率在 38.7% 至 54.6% 之间,并随模型、秘密类型和说服强度明显变化。在测试的漂移窗口内,额外的话题漂移并未可靠降低泄露,作者据此认为活跃 LLM 场景中的隐私风险应被视为持续的行为失效模式,而非仅训练数据记忆或即时越狱行为。

  9. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 论文37

    论文提出保险库中介执行边界,评估 LLM Agent 的 API 凭据处理风险

    论文将工具调用型 LLM Agent 的凭据卫生问题定义为执行安全问题,并评估了一种保险库中介执行架构:模型只选择连接器标识符,由可信请求边界提供认证。作者在 Corvic Security Vault 的生产实现上做了两组受控黑盒实验,覆盖七个控制域的 16 项探测全部达到预期结果,包括一次已认证的 GitHub API 请求成功,而凭据未出现在进程环境变量、调用方可见请求头、受测文件系统位置、三个第三方回显服务和两个无关 API 源中,两个云实例元数据端点均不可达。论文同时报告了一个负面结果:某连接器的存储请求头映射不满足其提供方的认证契约,说明集中托管本身不能保证配置正确。

  10. arXiv · 收录 · 原文 论文41

    面向旧款 GPU 的可验证差分隐私训练框架:用 CPU 侧 TEE 校验 GPU 梯度

    论文提出一种在旧款 GPU 上实现可验证差分隐私(DP)训练的框架,用 CPU 侧 TEE 配合不受信任的 GPU 完成校验。作者指出,零知识证明等密码学方案开销过大,有时高出数个数量级,而支持大语言模型训练与微调的多 GPU TEE 仅限较新平台,在旧款 GPU 上缺失或效率低下。该设计把昂贵的梯度计算卸载到 GPU,由 CPU TEE 通过概率性检查验证梯度上 DP 是否被正确执行,以缓解全在 CPU TEE 内训练过慢、无限制卸载又可能被恶意偏离 DP 的效率与安全矛盾。框架能以高概率检测频繁的完全偏离;在本文评估的面向效用的伪造梯度攻击中,稀疏偏离带来的效用收益有限,也未观察到可测量的额外成员泄露。

9月30日周三
  1. arXiv · 收录 · 原文 论文53

    研究者提出针对黑盒 LLM 的实用密钥提取框架

    研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。

    推荐理由论文给出仅凭输出接口提取记忆密钥的两阶段方法,并附受控基准与真实系统验证,可对照现有白盒审计思路。

  2. arXiv · 收录 · 原文 论文43

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    研究者提出 IDUnlearn-Bench,称其为首个面向视觉语言模型个体级多模态遗忘的基准,把每个人表示为相互关联的多模态证据,并设置属性访问、身份访问、身份绑定和身份重建四类任务。在代表性 VLM 和遗忘方法上的实验显示,属性层面的遗忘成功往往仍保留大量身份级知识,且效果可能非单调,降低一类风险反而放大另一类。模型可能压制部分信息,却仍能识别目标、关联记录或重建该个体。

  3. arXiv:后门、投毒与隐私 · 收录 · 原文 论文48

    近重复家族干扰精确记录成员推断,CC-News 上误判率达 99.70%

    论文指出,成员推断(MI)常被用于数据溯源与版权审计,但网络规模数据集天然包含转载文章、镜像页面等近重复内容,会混淆对精确记录是否参与训练的判定。作者提出四世界审计,独立变化精确记录是否包含与家族是否存在;在 CC-News 上,干净参考的 LiRA 审计器在 1.00% 假阳性率下把 99.70% 的家族存在但精确记录未参与训练的样本标为成员。

  4. arXiv:后门、投毒与隐私 · 收录 · 原文 论文55

    研究:众包微调数据投毒可放大专有指令抽取

    研究者提出一种针对众包监督微调(SFT)数据的投毒攻击,仅靠黑盒输出访问即可放大对其他用户贡献指令的抽取。攻击用主题锚点把领域主题与指令关联,并用替代模型和参考数据集挑选投毒锚点,部署后再用替代模型的似然分数自适应分配查询。在四个模型和两个数据集上,仅 50 条投毒样本就让 Qwen2.5-14B 在 OpenMathInstruct 上的近似逐字抽取率从 2.38% 升到 8.84%(3.71 倍),Llama-3.1-8B 在 AceReason 上从 1.90% 升到 5.85%(3.08 倍)。该攻击在仅控制约 2% 微调样本的情况下,效果超过控制约 49% 对齐数据的恶意提供方后门基线。CVDD、DATE、SIK 与 LLM 评判等过滤方法大多检测不到投毒样本,表现最好的 CVDD 在响应上 F-1 仅 0.378。

    推荐理由论文给出仅靠 2% 众包投毒样本放大微调数据抽取的具体倍数,并说明现有过滤方法难以识别这类样本。

  5. arXiv:后门、投毒与隐私 · 收录 · 原文 论文22

    机器遗忘在 ASR 中是否有效:arXiv 论文评估现有算法与评测工具

    一项提交至 ICASSP 2027 的研究评估了现有机器遗忘(MU)算法与评测工具是否适用于自动语音识别(ASR),发现基于梯度上升的算法能在隐私与效用间取得较好权衡,而更复杂的方法会过度遗忘样本、反而更容易被识别为已遗忘。研究指出,基于简单成员推理攻击的标准隐私评估不足以可靠判断遗忘是否成功,且顺序遗忘与同时遗忘的隐私和效用均差于单主体遗忘。

  6. arXiv:后门、投毒与隐私 · 收录 · 原文 论文35

    物理认证联邦学习:为关键水务基础设施的协同异常检测提供安全保障

    研究提出"物理认证联邦学习",将守恒定律、执行器耦合等信息物理过程不变量从运行时检测启发式改造为联邦更新的可验证准入条件,自动从干净运行数据中挖掘。在 SWaT、WADI 两个水务测试床和 BATADAL 基准上,挖掘出的不变量对 100 个诚实分片零拒绝,并全部拒绝朴素伪造更新,包括 FoolsGold 完全放行的优化扰动。

  7. arXiv:后门、投毒与隐私 · 收录 · 原文 论文29

    无需参考模型:用邻居样本校准单轮成员推理攻击

    针对单轮成员推理(MI)中缺少参考模型、逐样本校准无法估计的问题,研究提出用目标点的邻居样本恢复校准信号,无需训练任何额外模型。方法通过两种互补方式获取邻居,并用早期训练检查点查询进一步锐化信号。在三个图像分类数据集和三种训练设置上,邻居样本给出了强成员信号和有竞争力的攻击性能,且不增加训练成本。

已经到底了