研究揭示投机解码的安全代价并提出 SecureSD 加固方法
Secure Speculative Decoding for Large Language Models
AI 导读
研究对投机解码的安全影响做了系统性测量,发现存在明显的安全与效用不对称:在多种有损投机解码方法中,推理效率提升带来的越狱和提示注入攻击成功率上升速度远快于效用下降。作者据此提出 SecureSD,理论分析指出安全退化主要来自 draft model 生成的早期 token,因此对早期解码位置的 draft token 采用更严格的验证标准。在安全与效用基准上的实验显示,SecureSD 在保持效率和效用的同时显著提升安全性。