跳到正文
10月8日 · 周四

Agent 安全 · 论文

找到 1 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 3 篇还没打标签,不在筛选结果里。

另有 3 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv:2608.16465 ·

    JailbreakSkill:用可复用可演化技能扩展自动化红队

    提出JailbreakSkill,用可演化技能自动搜索并复用越狱提示

    测试
    GLM 5.2、DeepSeek-V4-Pro Preview、Llama-3.3-70B-Instruct 等 8 个提示层
    场景
    模型与 API攻击者黑盒
    摘要论文提出以可复用与持续演化技能为核心的红队框架,提升了预算受限下的攻击成功率并积累了可跨模型迁移的越狱规程。
    • 核心定位:论文提出了 JailbreakSkill,这是一个将自动化红队攻击方法表示为可复用且持续演化的智能体技能的黑盒越狱框架。
    • 解决的问题:传统红队方法往往将改写逻辑与具体工作流或提示词深度绑定,无法独立调用与修改,且历史攻击失败的经验难以转化为可复用的独立攻击能力。
    • 方法设计:将攻击能力划分为改写、失败分析与演化三类标准化技能;Stage 1 利用基于风险类别的 UCB 算法在有限查询预算内自适应调用初始技能并早停;Stage 2 聚合未解决的失败轨迹,通过失败分析技能诊断模式,驱动细化、组合或发现生成新技能,并经残差池验证后入库。
    • 关键定量结果:在 AdvBench 和 HarmBench 上,Stage 1 UCB 调度取得 72.0% 与 68.1% 的宏平均 ASR@10,平均查询次数为 4.14 与 4.63 次(Table 1, Table 2);Stage 2 演化使五类模型的宏平均 ASR 提升至 74.2% 与 67.9%,其中对 GPT-5.4 在 AdvBench 上的 ASR@30 提升至 62.5%(Table 3);演化出的部分技能在未见模型 DeepSeek-V4-Pro 上取得 40.6% 的平均 ASR(Table 4)。
    • 作者结论与启示:作者认为自动化红队应当从重复搜索孤立的对抗提示词,转向维护和积累可跨任务与跨模型复用的模块化攻击技能库。
    完整解读
已经到底了