跳到正文
10月9日 · 周五

全部论文

找到 6 篇

另有 429 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2510.10987

    DITTO:通过知识蒸馏伪造水印 LLM 的作者归属

    提出 DITTO 框架,蒸馏提取水印信号并注入外部模型以伪造归属

    发表
    攻击者
    黑盒
    被测模型
    Llama3.1-8B、Llama3.2-3B、GPT-OSS 20B 等 4 个

    摘要论文针对大模型水印归属假设的脆弱性,提出黑盒仿冒攻击 DITTO,实现跨架构和采样方案的高检测率与低困惑度仿冒。

    深度解读完整解读
  2. 攻击arXiv 2610.03124

    研究提出 Untag 攻击框架,使开源大模型触发标签滥用检测机制失效

    提出 UNTAG,绕过开源权重模型的 trigger-tag 滥用检测

    发表
    攻击者
    黑盒、白盒
    摘要作者用 UNTAG 评估 trigger-tag,认为其不能充当开放权重滥用检测的主要边界。

    UNTAG 是针对开放权重 LLM 上条件滥用检测 trigger-tag 的统一攻击评估:信号可以在解码期注入,也可以写进权重,但攻击者若能改输出或改已发布权重,检测可以失效。

    深度解读完整解读
已经到底了