攻击arXiv:2610.05089 · 10月4日研究者披露 LiteLLM 网关跨租户干扰攻击 Cooldown Landmines提出 Cooldown Landmines 跨租户冷却干扰攻击并设计租户隔离LLM 应用·测试Qwen1.5-MoE-A2.7B-Chat、DeepSeek-MoE-16B-Chat·基础设施层权限与审批拒绝服务摘要揭示网关共享冷却漏洞,提出来源检查与租户隔离防御。完整解读
防御arXiv:2609.01091 · 9月1日上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移模型与 API·测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Gemma-3-12B-IT 等 4 个·训练与数据层模型加固投毒与后门失准与价值偏离微调与开源权重摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。完整解读
防御arXiv:2610.00685 · 10月2日研究者提出用零空间投影净化 LoRA 微调 LLM 的后门用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力模型与 API·测试LLaMA2-7B-Chat、LLaMA2-13B-Chat、Qwen2-7B-Instruct 等 6 个·训练与数据层模型加固投毒与后门微调与开源权重完整解读
防御arXiv:2610.00348 · 10月2日NEEDLE:通过权重正交化移除 LLM 后门提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门模型与 API·测试Gemma-3-4B-IT、Qwen3-4B-Instruct-2507、Gemma-3-12B-IT·模型层模型加固投毒与后门微调与开源权重摘要NEEDLE 用闭式权重编辑去掉已知触发器的后门,并保住拒绝子空间。完整解读