跳到正文
原文
arXiv:后门、投毒与隐私· arXiv:2609.10935· William Novak·· 22 天前

针对 NLP 文本分类器的成员推理攻击实证评估:SST-2 基线研究

Empirical Evaluation of Membership Inference Attacks on NLP Text Classifiers: A Baseline Study on SST-2

AI 导读

一项在 GLUE SST-2 情感数据集上的受控基准测试比较了 TF-IDF + Logistic Regression 与微调 DistilBERT 在 loss-threshold 成员推理攻击(MIA)下的隐私泄露情况。DistilBERT 开发集准确率 0.9466、macro F1 0.9460,Logistic Regression 为 0.8756 和 0.8727,但两者均泄露成员信号,攻击 AUC 分别为 0.5615 和 0.5800。

阅读原文arxiv.org