跳到正文
10月8日 · 周四

全部论文

找到 4 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 1033 篇还没打标签,不在筛选结果里。

另有 1033 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2608.08542 ·

    SkillSafe-Bench:技能合并模型静态安全无法预测自适应越狱鲁棒性

    评测技能合并模型的自适应越狱鲁棒性,并提出子空间投影防御

    模型与 API攻击者白盒测试Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct、Mistral-7B-Instruct-v0.3 等 6 个模型层
    摘要论文报告了技能合并大模型在静态安全与自适应越狱间的脱节,提出了评测基准与无数据子空间投影修复方法。

    本研究针对开源语言模型技能合并过程中的安全评估盲区,系统评测并刻画了合并大模型在自适应越狱攻击下的脆弱性特征。

    完整解读
  2. 防御arXiv:2609.23596 ·

    StyleAT:用对抗训练防御人脸识别的语义攻击

    提出 BoundStyle 与 StyleAT,对抗训练防御人脸识别语义攻击

    模型与 API攻击者白盒黑盒测试MobileFaceNet (MobileFace)、ResNet (ResNet-152, IR-SE)、RepVGG 等 7 个训练与数据层
    摘要BoundStyle 用 StyleGAN3 有界潜编辑快速攻击 FR。

    StyleAT 用可调的 StyleGAN3 潜空间攻击 BoundStyle 对人脸识别做对抗训练,以抵抗一般语义编辑,并在评测中面对训练时未见的 DiffPrivate。

    完整解读
已经到底了