攻击arXiv 2608.16465
JailbreakSkill:用可复用可演化技能扩展自动化红队
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
- arXiv
- 2608.16465
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 攻击者
- 黑盒
- 测试
- DeepSeek-V4-Pro Preview、GLM 5.2、Llama-3.3-70B-Instruct 等 8 个
提出 JailbreakSkill,用可演化技能自动搜索并复用越狱提示
评测 System One 模型对 Agent 安全输入的分类可靠性与校准
Liu 离线评测 System One 模型能否为智能体安全输入给出可自动化的概率决策。问题是分类是否可靠,以及概率能否在指定漏检和误拦上限内支持放行、拦截或复核。