研究者称仍可通过第三方云聚合商窃取美国前沿模型的推理轨迹
研究者对 OpenAI、Anthropic 直连端点及 AWS Bedrock、Microsoft Azure、OpenRouter 等下游云聚合商做了审计,发现厂商针对推理轨迹提取的修补碎片化且易被绕过。推理重放攻击在 Azure 上对每个 OpenAI 模型(含 GPT-6 Astra)以及 Anthropic 直到 Sonnet 5 的模型仍间歇有效,一次解码即可逐字还原轨迹;scratchpad 攻击仍能从所有 OpenAI 模型以及 Opus 4.8、Sonnet 5 提取推理,目前只有 Opus 5、Fable 5、Fable 5.1 不暴露推理。作者指出下游主机存在补丁传播延迟和策略漂移,攻击者无需绕过主厂商护栏,只需把请求路由到未同步防护的下游主机即可,并建议对无法同步执行推理轨迹保密与工具范围护栏的云主机不予授权。
推荐理由作者实测多家云聚合商上的推理轨迹提取,指出厂商补丁在下游存在传播延迟,可据此检查多云部署的防护一致性。