CacheTrap:研究者提出针对 LLM KV cache 的灰盒木马攻击
CacheTrap: Unveiling a Stealthier Gray-Box Trojan against LLMs
AI 导读
研究者提出 CacheTrap,一种针对 LLM 的 Key-Value(KV)cache 的灰盒木马攻击。该方法在 KV cache 中翻转单个比特作为瞬时触发器,激活后使模型执行指定行为,且不改变输入或模型权重。作者称这是首个针对 LLM KV cache 的灰盒木马攻击,并提出一种高效搜索算法定位 KV cache 中的脆弱位置,不依赖模型权重或数据集。在五个开源 LLM 上的实验显示,仅翻转 KV cache 中一个比特即可在触发时达到接近 100% 的攻击成功率,同时保持无触发时的正常准确率。该工作已被 ICCAD 2026 接收。