攻击arXiv 2605.22258·5月21日CITA:面向中文隐式毒性的攻击与防御数据生成框架提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本arXiv2605.22258发表5月21日层应用层场景LLM 应用被测模型Tencent、Baidu、Gemini 3.1 Pro 等 11 个攻击检测规避技术编码与混淆组件护栏与评审+1+1深度解读完整解读
攻击arXiv 2512.20168·2025年12月23日Odysseus 用双重隐写越狱 GPT-4o、Gemini-2.0 与 Grok-3提出双重隐写越狱 Odysseus,用图像隐写绕过多模态系统安全过滤器arXiv2512.20168发表2025年12月23日层应用层场景AI Agent攻击者黑盒被测模型GPT-4o-2024-08-06、Gemini-2.0-pro、Gemini-2.0-flash 等 4 个攻击越狱技术编码与混淆组件护栏与评审+2+2深度解读完整解读