分析与理论arXiv:2610.02586 · 10月1日研究发现类型化决策模型主要按选项标签而非定义作答揭示类型化决策模型按选项标签而非定义规则作答模型与 API·测试von、Qwen2.5-0.5B、Qwen2.5-1.5B 等 6 个·提示层护栏与评审摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。完整解读
评测与基准arXiv:2610.02827 · 10月2日MLCommons 发布 Jailbreak Benchmark v1.0构建 MLCommons 越狱基准以测量模型的单轮越狱韧性模型与 API·测试Gemma 3N E4B Instruct、LFM2-24B-A2B、Qwen 2.5 7B Instruct Turbo 等 8 个·提示层越狱摘要论文建立了单轮越狱评测的标准化端到端方法学体系,揭示了开源大模型在对抗提示词下的安全性能降级与大模型负差距现象。完整解读
攻击arXiv:2510.11570 · 2025年10月14日研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏提出四种阶段转换攻击,绕过推理模型的安全推理护栏模型与 API攻击者白盒黑盒·测试gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个·提示层越狱推理链操控推理链+2+2完整解读