跳到正文
10月9日 · 周五

全部论文

找到 5 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 648 篇还没打标签,不在筛选结果里。

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    测试
    GPT-2 Small、GPT-2 Medium、GPT-2 Large 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  2. 防御arXiv 2609.15671

    QPriv-VL:面向视觉语言模型的问题引导 token 裁剪隐私防御

    提出 QPriv-VL,用问题引导剪枝降低分布式视觉问答的隐私泄露

    发表
    测试
    LLaVA-1.5-7B、CLIP-ViT-L/14、Llama-2 等 4 个
    摘要QPriv-VL 在切层前按问题相关度与 DINOv2 敏感度剪视觉 token,作者称能在约四成 token 下兼顾准确率与四类攻击。

    QPriv-VL 把问题引导的视觉 token 剪枝做成分布式 VQA 的客户端隐私防御,而不是只做集中式推理加速。

    深度解读完整解读
  3. 评测与基准arXiv 2609.33481

    IDUnlearn-Bench:面向视觉语言模型的个体级遗忘基准

    提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留

    发表
    测试
    Qwen3-VL-2B、Qwen3-VL-4B、Qwen3-VL-8B 等 6 个
    摘要IDUnlearn-Bench 用四族探针显示:压低直接属性访问后,身份仍常能被反向查出、绑定或重构。

    IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。

    深度解读完整解读
  4. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    测试
    Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
已经到底了