跳到正文
10月9日 · 周五

全部论文

找到 6 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 700 篇还没打标签,不在筛选结果里。

另有 700 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.01365

    ReGap:无需真实隐私数据即可通过微调重新提取模型隐私关联

    提出 ReGap,用自生成伪监督微调恢复模型中的隐私关联

    发表
    攻击者
    白盒、灰盒
    测试
    OPT-1.3B、GPT-2 Small、GPT-2 Medium 等 6 个

    摘要提出无真实私有监督的恢复攻击 ReGap,实验显示微调可通过自生成数据唤醒模型潜在隐私关联,突显后适应隐私风险。

    深度解读完整解读
  2. 攻击arXiv 2609.10611

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员

    发表
    攻击者
    黑盒
    测试
    OPT-6.7B、LLaMA-13B、Pythia-6.9B 等 12 个
    摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。

    WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。

    深度解读完整解读
  3. 攻击arXiv 2609.14649

    CIG-MIA:利用上下文信息增益对 RAG 系统发起成员推断攻击

    提出 CIG-MIA,用上下文信息增益推断 RAG 知识库成员身份

    发表
    攻击者
    灰盒、黑盒
    测试
    Llama-3.1-8B-Instruct、Llama-2-13b-chat-hf、Mistral-7B-Instruct-v0.3 等 6 个
    摘要CIG-MIA 用注入前后的答案似然差推断 RAG 库成员,灰盒可分性高于所列基线。

    CIG-MIA 是针对 RAG 外部知识库的成员推断攻击,同时覆盖灰盒和纯文本黑盒。

    深度解读完整解读
  4. 攻击arXiv 2609.33985

    研究:众包微调数据投毒可放大专有指令抽取

    提出主题锚点投毒,放大众包微调后的专有指令提取

    发表
    攻击者
    黑盒
    测试
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct 等 6 个

    摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。

    深度解读完整解读
已经到底了