攻击arXiv:2610.05894 · 10月5日研究者提出闭环偏见注入攻击提出闭环激活引导,在扩散语言模型去噪过程中注入定向偏见模型与 API攻击者灰盒·测试LLaDA-8B-Instruct、Dream-v0-Instruct-7B、LLaDA-MoE-7B-A1B-Instruct·模型层模型篡改梯度与表征优化摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。完整解读
防御arXiv:2610.00685 · 10月2日研究者提出用零空间投影净化 LoRA 微调 LLM 的后门用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力模型与 API·测试LLaMA2-7B-Chat、LLaMA2-13B-Chat、Qwen2-7B-Instruct 等 6 个·训练与数据层模型加固投毒与后门微调与开源权重完整解读
分析与理论arXiv:2609.05241 · 9月4日10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发测绘去安全开源模型的生产、重分发与下游应用留存机制模型与 API·测试Qwen、Llama、Gemma 等 10 个·训练与数据层模型篡改微调与开源权重摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。完整解读
攻击arXiv:2608.29458 · 8月30日Reference-Grafting 在提取沙袋行为隐藏能力上追平微调提出参考嫁接,在推理时用激活干预诱导出沙袋隐藏的能力模型与 API攻击者白盒·测试Qwen2.5-1.5B、Qwen2.5-3B、Qwen2.5-14B 等 15 个·模型层模型篡改欺骗与谋划梯度与表征优化摘要提出参考嫁接在推理阶段以低成本匹配微调诱导效果,揭示隐瞒表征重叠与阈值门控机制。完整解读
攻击arXiv:2609.14060 · 9月13日AgentQ:针对 LLM Agent 的量化条件后门攻击提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门AI Agent·测试Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。完整解读