攻击arXiv:2608.29458 · 8月30日Reference-Grafting 在提取沙袋行为隐藏能力上追平微调提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力模型与 API攻击者白盒·测试Qwen2.5-1.5B、Qwen2.5-3B、Qwen2.5-14B 等 15 个·模型层模型篡改欺骗与谋划梯度与表征优化摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。完整解读
攻击arXiv:2609.14060 · 9月13日AgentQ:针对 LLM Agent 的量化条件后门攻击提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门AI Agent·测试Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。完整解读