攻击arXiv 2609.01023
Akrasia:针对推理型代码 LLM 的隐蔽后门攻击
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
- arXiv
- 2609.01023
- 发表
- 层
- 提示层
- 被测模型
- Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 AudioHijack,用不可感知对抗音频对语音模型做上下文无关提示注入
摘要提出了 AudioHijack 框架,揭示了 LALM 对听觉提示注入的脆弱性与传统防御的局限。
提出 CoTTA 隐蔽视觉提示注入,使多模态模型输出指定指令
摘要CoTTA 以隐蔽触发和双目标对齐诱导指定句子。