攻击arXiv 2603.13847·3月14日SWhisper 用近超声隐蔽声学通道对语音驱动 LLM 实现黑盒越狱提出 SWhisper,用近超声波向语音驱动 LLM 隐蔽注入越狱提示arXiv2603.13847发表3月14日层应用层场景LLM 应用攻击者黑盒攻击越狱技术跨模态载荷组件音频+1+1深度解读完整解读
防御arXiv 2610.01058·10月2日MOMAT:面向量化 LLM 低功耗越狱防御的多图集混合框架提出 MOMAT 多图集检索与轻量判定,防御量化模型越狱arXiv2610.01058发表10月2日层提示层场景模型与 API被测模型Llama2-13B、Llama2-7B、Mistral-7B防御检测与过滤攻击越狱组件护栏与评审+1+1深度解读完整解读
防御arXiv 2609.29287·9月24日AEGIS:用内部信号在中间层拦截大型音频语言模型越狱提出 AEGIS,用中层内部信号选择性激活后层适配器拦截音频越狱arXiv2609.29287发表9月24日层模型层场景模型与 API攻击者白盒防御推理时干预攻击越狱组件音频+1+1深度解读完整解读