攻击arXiv 2609.01023
Akrasia:针对推理型代码 LLM 的隐蔽后门攻击
提出推断期后门攻击 AKRASIA,用代码触发器与伪装推理篡改代码输出
- arXiv
- 2609.01023
- 发表
- 层
- 提示层
- 场景
- 编程 Agent
- 测试
- Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出推断期后门攻击 AKRASIA,用代码触发器与伪装推理篡改代码输出
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 SkillDRE,用预执行与运行时反馈演化恶意技能
提出 MMSkillRisk 与 NCVA,评测技能图像隐藏指令诱导的未授权操作
摘要论文提出 MMSkillRisk 基准与 NCVA 攻击,揭示多模态技能中教学图像潜藏指令可引发未授权操作并与良性任务共存。