分析与理论arXiv 2607.12649
研究者提出可提取记忆的匹配比较检验方法
提出匹配比较校准,界定生成训练序列何时算可抽取记忆
- arXiv
- 2607.12649
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Llama 3.1 70B、Llama 3.1 base、Llama 2 13B 等 7 个
摘要匹配非成员校准阈值后,短序列抽取含大量假阳性,极低概率过阈值也不等于可抽取。
Cooper 等人从第一性原理重写 extractable memorization:生成训练文本只有在概率高过匹配非训练文本的可预测性基线时,才支持记忆声称。