评测与基准arXiv 2512.20677·2025年12月22日研究提出基于学习的自动化对抗红队框架,用于大语言模型鲁棒性评测提出约束对抗搜索红队框架,系统发现模型多类鲁棒性漏洞arXiv2512.20677发表2025年12月22日层模型层场景模型与 API被测模型GPT-OSS-20B、LLaMA-2-13B、Claude-2风险欺骗与谋划组件推理链+2+2深度解读完整解读