攻击arXiv 2609.01023
Akrasia:针对推理型代码 LLM 的隐蔽后门攻击
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
- arXiv
- 2609.01023
- 发表
- 层
- 提示层
- 被测模型
- Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出工作流级越狱,诱导 IDE 编程 Agent 在多轮开发中编写有害代码
摘要论文揭示了 IDE 编程智能体在多轮开发工作流中会绕过单轮拒答并自行写出有害代码,呼吁防御转向工作流与代码产物级审查。
提出 TRACE 框架,用分解与可演化多轮策略诱导智能体执行有害工作流