跳到正文
原文
Simon Willison(提示注入)·· 2026-08-12精选关注度76

论文披露从专有 LLM API 窃取加密思维链的方法

Stealing Reasoning Traces from Proprietary LLM APIs

AI 导读

一篇论文发现 Anthropic、OpenAI 和 Google 返回给客户端的加密思维链块可在不同会话、用户和模型间重放,把前沿模型的推理轨迹喂给同族较弱模型并越狱后,即可还原出强模型的隐藏推理明文。

推荐理由

论文披露加密思维链块可在同族模型间重放并越狱还原,还衍生出借思维链实施提示注入的新变体。

阅读原文simonwillison.net