跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.36956· Jesson Wang·· 2 天前

研究者提出 Controlled Decoding Attacks,通过纯文本接口越狱黑盒 LLM

Controlled Decoding Attacks on Black-Box LLMs

AI 导读

研究者提出一种针对黑盒大语言模型的越狱框架,仅通过允许重复采样和助手前缀续写的纯文本接口实施攻击,无需模型权重或数值 token 概率。该方法用采样输出结合未观测动作先验重建分布,再依据响应前缀决定在哪些位置重建和修改分布,并用推测式多 token 执行摊薄目标调用成本。在四个目标端点和三个基准上,该方法在多数对比中取得最高平均分。

阅读原文arxiv.org