攻击arXiv 2609.01023
Akrasia:针对推理型代码 LLM 的隐蔽后门攻击
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
- arXiv
- 2609.01023
- 发表
- 层
- 提示层
- 被测模型
- Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出隐蔽后门攻击 AKRASIA,在推理代码模型提示中植入触发器并伪装思维链
摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。
提出 SCHEMA,用概念图与轨迹分评测科学 Agent 幻觉
SCHEMA 是面向科学智能体幻觉的证据锚定评测框架,实例化在生物医学的 Protein Domain 与 PathVQA-Enhanced。作者在摘要中称它是首个同时做到证据锚定和拓扑感知的此类框架。
提出针对 Agent 护栏的推理扩展拒绝服务攻击