评测与基准arXiv 2610.02986
OLMo-Detect:面向 LLM 成员推断的多阶段混淆控制基准
提出基准 OLMo-Detect 评测 LLM 成员推断
- arXiv
- 2610.02986
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- OLMo 2 1B、OLMo 2 7B、OLMo 2 13B 等 9 个
- 攻击提取与窃取
提出基准 OLMo-Detect 评测 LLM 成员推断
提出 aiXamine 黑盒基准,统一评测 LLM 安全、稳健与隐私权衡
aiXamine 是一套黑盒评测协议,用来在同一条件下比较 LLM 的 safety、security 与 privacy,而不是再产出一个能力分。
提出 COVER,在语言预算下选择源语言实现跨语言知识遗忘
语言预算下的多语言遗忘:遗忘监督只放在 K 种源语言上,目标是降低其余语言对同一事实的残余访问,而不是把每种评测语言都译成监督数据。
提出 PrivDrift 基准,审计话题漂移后的用户秘密复述
提出 IDUnlearn-Bench,评测 VLM 个体级遗忘后的身份残留
IDUnlearn-Bench 评测 VLM 是否忘掉一个可跨模态识别的人,而不只是答不出某条监督事实。
摘要梯度上升类方法更接近简单评测下的重训参照,复杂方法会被知情攻击认出,多说话人更差。