攻击arXiv 2609.01023
Akrasia:针对推理型代码 LLM 的隐蔽后门攻击
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
- arXiv
- 2609.01023
- 发表
- 层
- 提示层
- 被测模型
- Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 RolePlay 框架,用人设条件放大 LLM 单次推理开销
提出层级遗传算法 HGA,扰动题目逻辑结构诱发推理模型过度思考
摘要HGA 在黑盒推理模型上用逻辑扰动拉长输出,作者称可从小代理迁移,查询成本是其局限。