跳到正文
10月9日 · 周五

全部论文

找到 1 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 532 篇还没打标签,不在筛选结果里。

另有 532 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2609.35699

    论文:蒸馏防御在蒸馏后强化学习下易被攻破

    提出用 API 推理摘要重建轨迹再蒸馏加强化学习,攻破蒸馏防御

    发表
    攻击者
    黑盒
    测试
    Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B 等 12 个
    摘要更现实的蒸馏攻击是蒸馏后再 RL。

    这篇工作修订蒸馏攻击的威胁模型:攻击者经合法 API 收集闭源推理数据,先蒸馏自有模型,再做强化学习。作者认为只在蒸馏后评估防御,会漏掉后续 RL,从而高估防御。

    深度解读完整解读
已经到底了