研究者提出针对黑盒 LLM 的实用密钥提取框架
Practical Secrets Extraction against Black-box LLMs
AI 导读
研究者提出一套仅依赖输出接口的黑盒密钥提取框架,用于从商业 API 大模型中提取被记忆的 API key。方法分两阶段:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏到本地白盒代理;再在代理上用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验筛选候选。在含 5 家厂商、4 种编程语言共 100 个真实密钥的受控基准上,恢复效果较代表性基线最高提升 57.1%,真实密钥比例最高提升 2.6 倍,构建后提取延迟降低 20.7 至 34.8 倍。真实环境评估从三个独立部署的黑盒系统中恢复了被掩码的厂商凭证,涉及 OpenAI 与 Claude Code,GitHub 搜索显示这些密钥存在公开匹配,作者出于伦理未发起实际 API 调用。
论文速读
- 商业 API 型 LLM(如 Codex、Claude Code)的训练语料可能包含公开仓库或私有开发数据中泄露的凭证,模型可能记住这些密钥并被提取。已有审计方法大多依赖模型权重或 token 概率,无法适用于仅返回文本的闭源接口。
- 提出两阶段黑盒框架:先用语义保持的提示变体、响应交叉验证和厂商格式过滤,把受害模型的密钥相关行为蒸馏成本地白盒代理;再用截断 top-p 采样配合局部 token 熵、N-gram 频率和厂商结构先验做候选生成与过滤,把远程交互限制在知识获取阶段。
- 在 5 个厂商、3 个受害模型、2 个代理上的受控 API-key 基准中,恢复量相对最强基线提升最高 25.0%,真实密钥率最高提升 2.6 倍,提取延迟降低最高 34.8 倍;消融显示弱扰动效果最好,熵筛选与 4-gram 抑制组合提升真实率。真实世界评估从三个独立部署的黑盒 LLM 中恢复了被掩码的厂商凭证,GitHub 搜索找到公开匹配。
- 真实世界评估仅做掩码披露,出于学术伦理未发起实际 API 调用;代码与材料计划未来发布。作者指出该结果说明仅输出访问即可暴露记忆的密钥,构成商业 LLM 部署的实际安全风险,并呼吁更严格的预训练数据清洗。
据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。
推荐理由
论文给出仅凭输出接口提取记忆密钥的两阶段方法,并附受控基准与真实系统验证,可对照现有白盒审计思路。