攻击arXiv:2608.29381 · 8月30日研究者提出 Agent 检查点回滚的五类安全失效,并在 Hermes、Cline、LangGraph 上实现三种攻击提出破坏执行连续性的回滚攻击,揭示检查点恢复的安全故障AI Agent·测试DeepSeek-v4·应用层Agent 危险操作权限与沙箱摘要论文系统研究了智能体 C/R 的安全性,分析了合法回滚破坏执行连续性的机理,并实证评估了其普遍性与危害。完整解读
攻击arXiv:2609.01023 · 9月1日Akrasia:针对推理型代码 LLM 的隐蔽后门攻击提出 AKRASIA 推断期后门,用代码级触发器与伪装推理操纵代码模型编程 Agent·测试Claude-Sonnet-5、GPT-5.5、Gemini-3.5-flash 等 7 个·提示层提示注入潜伏触发推理链+1+1摘要论文针对推理代码大模型提出了隐蔽推断期后门攻击 AKRASIA,揭示了模型思维链可被利用进行欺骗性伪装的安全隐患。完整解读
攻击arXiv:2609.33985 · 9月28日研究:众包微调数据投毒可放大专有指令抽取提出主题锚点投毒,放大众包微调后的专有指令提取模型与 API攻击者黑盒·测试Qwen2.5-7B-Instruct、Qwen2.5-14B-Instruct、Llama-3.1-8B-Instruct 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重+1+1摘要论文提出基于主题锚点的数据中毒攻击,证明低比例的中毒样本可在黑盒条件下隐蔽放大微调指令泄漏。完整解读