攻击arXiv 2510.11570
研究显示简单攻击可绕过 gpt-oss 等推理模型的安全护栏
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
- arXiv
- 2510.11570
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 被测模型
- gpt-oss-20b、gpt-oss-120b、Qwen3-4B-Thinking-2507 等 10 个
提出四种阶段转换攻击,绕过推理模型的安全推理护栏
用词级归因指导同义词替换,翻转提示注入检测并验证越狱
摘要作者称检测靠分散的词法线索。
提出技能级联攻击,将恶意目标分散于多个技能以绕过单技能检测
摘要论文探讨了多技能智能体系统面临的技能级联攻击风险,提出自动化红队框架与基准集,指出跨技能交互存在安全防护盲区。