Akrasia:针对推理型代码 LLM 的隐蔽后门攻击
提出AKRASIA推断期后门,用代码级触发器与伪装推理操纵代码模型
- 研究定位:论文针对代码推理大模型提出了一种利用上下文学习与模型不忠实性构建的推断期隐蔽后门攻击框架AKRASIA。
- 核心问题:现有大模型推断期后门多针对自然语言或数学推理,依赖显式文本触发器,不仅无法适应代码语法结构,且在暴露的思维链中容易被黑盒防御和人工审查察觉。
- 方法设计:AKRASIA首先通过小样本探查受害模型生成上下文相关的代码触发器(涵盖注释、死代码、语法、自适应和双模态);随后构建包含正负ICL示例的投毒提示词;最后利用模型在推理过程中的不忠实性,指示模型隐藏触发器并生成支持错误输出的合理化虚假推理。
- 关键实验发现:实验覆盖6个主流推理模型与3个代码基准。在CodeMMLU代码补全任务中,AKRASIA在Gemini-3.5-flash上达到99.34%平均ASR(Table 5);在LiveCodeBench代码生成任务中,AKRASIA-U在Gemini-3.5-flash上实现90.4%平均ASR和93.0%中毒ACC(Table 4);在3种SOTA防御测试中,AKRASIA在14/18个设置中维持55.36%至98.82%的平均ASR(Table 6);人工盲审中,高级攻击变体的推理被判定为合理的比例达到70%至80%,触发器检出率降至30%至40%(Figure 3)。
- 特例与失效分析:GPT-5.5在CodeMMLU上的AKRASIA-UR版本ASR降至4.08%(Table 5),但在基础版本和不忠实版本下仍有44.04%与59.51% ASR(Table 12),作者将其归因于模型内部特定护栏的作用;自然语言基线BadChain在代码任务上的ASR降为0.0000(Table 9)。
- 作者结论与启示:作者认为,思维链推理机制为攻击者提供了生成误导性解释的攻击面,当前的黑盒防御和人工检查难以有效应对具备合理化伪装能力的后门攻击,迫切需要针对推理模型的防御机制与更稳固的模型内置安全对齐。