攻击arXiv:2510.11570 · 2025年10月14日研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏提出四种阶段转换攻击,绕过推理模型的安全推理护栏模型与 API攻击者白盒黑盒·测试gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个·提示层越狱推理链操控推理链+2+2完整解读
攻击arXiv:2609.14060 · 9月13日AgentQ:针对 LLM Agent 的量化条件后门攻击提出 AGENTQ,向开源智能体权重植入仅在量化后触发的恶意工具后门AI Agent·测试Qwen3.5-2B、Qwen3.5-4B、Qwen3.5-9B 等 6 个·训练与数据层投毒与后门潜伏触发微调与开源权重摘要论文研究了智能体量化条件后门风险,提出 AGENTQ 在保持效用的同时实现全精度隐蔽与量化后生效。完整解读