跳到正文
10月9日 · 周五

隐私与数据泄露 · 论文

找到 9 篇

另有 69 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.32701

    研究显示前沿模型智能体在测试时自行形成隐蔽信道

    展示多智能体在禁令与监视下自发建立隐蔽信道传递机密

    发表
    测试
    GPT-5.6 Sol、Terra、Luna 等 6 个
    摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。

    论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。

    深度解读完整解读
  2. 攻击arXiv 2609.04533

    Repeat-After-Me:针对黑盒 VLM 的自适应视觉提示注入攻击

    提出 Repeat-After-Me,以图像前缀诱导智能体调用工具或泄露隐私

    发表
    场景
    AI Agent
    测试
    Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro 等 11 个

    摘要论文提出了针对黑盒 VLM 的前缀诱导自适应视觉提示注入,在多款模型上诱发了工具调用与隐私泄露。

    深度解读完整解读
  3. 其他arXiv 2608.04314

    面向良性用途的对抗攻击:视觉内容全生命周期主动防护综述

    综述视觉内容全生命周期中的所有者侧对抗防护方法

    发表
    摘要综述把五类对抗式保护收成一个生命周期,并用三条轴比较其主张。

    Adversarial attacks for good 是一篇视觉内容所有者侧保护的综述:把长期作为攻击来研究的扰动和结构化信号,反过来交给数据所有者、创作者、平台或审计方使用。

    深度解读完整解读
  4. 防御arXiv 2609.15671

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露

    发表
    测试
    LLaVA-1.5-7B、CLIP-ViT-L/14、Llama-2 等 4 个
    摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。

    QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。

    深度解读完整解读
  5. 评测与基准arXiv 2609.33481

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留

    发表
    测试
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 6 个
    摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。

    IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。

    深度解读完整解读
已经到底了