跳到正文
10月10日 · 周六

全部论文

找到 2 篇
筛选6
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 216 篇还没打标签,不在筛选结果里。

另有 216 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    被测模型
    BERT (4.4M-340M)、ViT (22M-307M)、Pythia (70M-2.8B) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  2. 攻击arXiv 2606.11817

    研究:语法约束解码可越狱 LLM 生成恶意代码,并提出 CodeShield 防御

    提出 CodeSpear 越狱,借语法约束解码生成恶意代码,并给出 CodeShield 防御

    发表
    攻击者
    黑盒
    被测模型
    Qwen2.5-Coder-7B、Qwen2.5-Coder-32B、Qwen2.5-7B 等 10 个

    摘要论文发现语法约束解码会破坏自然语言安全对齐,提出 CodeSpear 越狱攻击与基于蜜罐代码对齐的 CodeShield 防御。

    深度解读完整解读
已经到底了