攻击arXiv 2605.22258·5月21日CITA:面向中文隐式毒性的攻击与防御数据生成框架提出 CITA 三阶段框架,生成可绕过毒性检测器的中文隐式毒性文本arXiv2605.22258发表5月21日层应用层场景LLM 应用被测模型Tencent、Baidu、Gemini 3.1 Pro 等 11 个攻击检测规避技术编码与混淆组件护栏与评审+1+1深度解读完整解读