跳到正文
原文
arXiv:后门、投毒与隐私· arXiv:2609.01023· Chua Jin Chou·· 2026-09-01精选关注度82

Akrasia:针对推理型代码 LLM 的隐蔽后门攻击

AKRASIA: Stealthy Backdoor Attack on Reasoning-based Code LLMs

AI 导读

研究者提出 Akrasia,一种针对推理型代码 LLM 的推理时后门攻击,通过探测模型构造代码级触发器,再用上下文学习植入后门,并借助模型不忠实性隐藏触发器、生成看似合理的推理。在 GPT-5.5、Claude Sonnet-5、Gemini 3.5 Flash、DeepSeek-V4-Pro、GLM 5.2、Qwen3.6-35B 六款模型上,攻击在 CodeMMLU 代码补全任务的平均 ASR 最高达 99.34%,同时保持最高 97.23% 的准确率。在 CoS、ONION、PeerGuard 三种防御下,Akrasia 在 14/18 个防御设置中仍保持最高 98.82% 的平均 ASR;人工检查中,进阶变体在最多 80% 的设置里成功隐藏触发器与推理步骤。攻击目标包括反向 shell、凭据窃取、资源耗尽和长运行时间,作者据此呼吁针对推理后门开发防御方法。

论文速读

问题
推理型 Code LLM 在编程任务上表现强,但其推理机制带来新的安全风险。已有推理后门攻击(如 BadChain、BadCodePrompt)只关注自然语言触发、忽略代码特征,且容易被 SOTA 防御和人工检查发现。
方法
作者提出 Akrasia,一种推理时后门攻击:先探测受害 LLM 生成代码级触发(如 comment、deadcode、bimodal 等),再用 in-context learning 植入后门,并利用 model unfaithfulness 隐藏触发、生成看似合理的推理。分 Base、Unfaithful、Unfaithful Reasoning 三种隐蔽等级。
实验与结果
在 6 个推理 LLM、3 个代码任务/数据集和 3 种防御上评测。作者报告 code completion 上 ASR 最高 99.34%、ACC 最高 97.23%;code generation 上 ASR 最高 90.4%;在多数(14/18)防御设置下保持最高 98.82% 平均 ASR;人工检查中最高 80% 设置下成功隐藏触发与推理。
局限与可以继续做的
作者指出未做 ICL 示例数量扰动实验,其他设置下表现可能变化;推理模型有随机性且无 temperature 设置,结果存在波动;外部效度受模型泛化性限制。未来计划研究如何有效防御 Akrasia。

据 论文全文(AI 生成) 整理,供快速了解,以论文原文为准。

推荐理由

论文给出推理型代码 LLM 后门在六款模型、三类任务和三种防御下的攻击成功率,可据此评估代码 Agent 的供应链风险。

阅读原文arxiv.org