跳到正文
原文
论文追踪· arXiv:2610.04763·本站收录 · 原文发表

UT Austin 将 SynthID 水印嵌入基因组语言模型,凭 DNA 序列和密钥追溯 AI 生成片段

Tracing model-generated DNA with position-independent watermarking

论文速读

防御

据论文 PDF 整理(AI 生成),以原文为准

SynthID嵌入两模型后,1,544条保留提示的3,088条带标记序列,未编辑和单碱基编辑后全部检出。

威胁模型验证者只收到DNA序列、密钥和已公布的检测器设置,不知道生成边界、链和六碱基token phase,并对全部窗口做一次Bonferroni校正后的序列决策。

问题
基因组模型生成的DNA不记录来源。作者希望生成时嵌入水印,使验证者只凭序列、密钥和已公布设置就能检出,而不知道起点、链或六碱基token phase。
方法
在Carbon-500M与GENERator-v2的采样中加入SynthID的30层锦标赛。验证者在两条链、每个起点和四种窗口上计分,并用Bonferroni对整次搜索做一次序列决策。
实验与结果
检测队列1,544条保留提示上,两模型未编辑和单碱基编辑后均找回全部3,088条带标记序列。普通序列假阳性上界至多0.850%;至2%每碱基随机编辑时作者称检出仍完整或接近完整。
局限与可以继续做的
作者称结果不是生物学功能、密钥安全或对看见检测器者的鲁棒性,且不是独立复制。实验覆盖两个六碱基模型、至多16条RefSeq染色体记录和随机编辑。
实验设置Carbon-500M、GENERator-v2-eukaryote-1.2b-base · RefSeq chromosome windows (development cohort)、RefSeq chromosome windows (detection cohort) · 序列级检出(Pseq≤0.01)、假阳性率的Clopper-Pearson单侧95%上界 等
威胁模型
验证者只收到DNA序列、密钥和已公布的检测器设置,不知道生成边界、链和六碱基token phase,并对全部窗口做一次Bonferroni校正后的序列决策。本实验的编辑随机放置且不查阅检测器;作者称未评估看见检测器的编辑者,也不把结果当作密钥安全或生物学功能。
被测模型
Carbon-500MGENERator-v2-eukaryote-1.2b-base
基准
RefSeq chromosome windows (development cohort)RefSeq chromosome windows (detection cohort)
指标
序列级检出(Pseq≤0.01)假阳性率的Clopper-Pearson单侧95%上界窗口强度(-log10 Pwin)模型分数(teacher-forced负对数似然)
AI 导读UT Austin 研究者把 SynthID 锦标赛水印嵌入 Carbon 与 GENERator-v2 两个基因组语言模型,验证者只需 DNA 序列、密钥和公开检测器设置即可判断序列是否由模型生成。在 1,544 条留出提示构成的检测队列中,水印检测找出了每个模型全部 3,088 条标记序列,包括未编辑以及替换、插入或删除一个碱基后的序列;搜索覆盖正反两条链、所有起始位置和四种窗口长度,并对整体搜索做决策校正。普通序列上的单侧 95% 假阳性率上界最高为 0.850%,错误密钥对照的一个上界达到 1.015%(Carbon 删除一个碱基后)。在开发队列中,两个模型在水印嵌入后未出现可检测的似然变化或预设序列指标变化;在与检测器无关的随机编辑下,每碱基 2% 编辑率以内检测仍保持完整或接近完整。

UT Austin 研究者把 SynthID 锦标赛水印嵌入 Carbon 与 GENERator-v2 两个基因组语言模型,验证者只需 DNA 序列、密钥和公开检测器设置即可判断序列是否由模型生成。在 1,544 条留出提示构成的检测队列中,水印检测找出了每个模型全部 3,088 条标记序列,包括未编辑以及替换、插入或删除一个碱基后的序列;搜索覆盖正反两条链、所有起始位置和四种窗口长度,并对整体搜索做决策校正。普通序列上的单侧 95% 假阳性率上界最高为 0.850%,错误密钥对照的一个上界达到 1.015%(Carbon 删除一个碱基后)。在开发队列中,两个模型在水印嵌入后未出现可检测的似然变化或预设序列指标变化;在与检测器无关的随机编辑下,每碱基 2% 编辑率以内检测仍保持完整或接近完整。

深度解读

6 个问题,点开问题读完整回答

  1. 这篇论文试图解决什么问题?

    生成时水印要在未知起点、链和token phase时,只凭序列与密钥被检出。

    核心问题是:只给出 DNA 序列、密钥和已公布检测器设置时,能否检出生成时嵌入的水印,而不知道生成区起点、所在链,以及六碱基 token 如何划分。

    • 场景:作者称基因组语言模型已能写编码序列、调控元件、基因组尺度构件和受功能约束的 DNA,但序列不记录它来自生物体、设计流程还是生成模型。作者把序列自带的来源信号视为紧急查询型合成基因库的补充,因为它不能与序列分开。
    • 同步困难:许多基因组模型使用互不重叠的六碱基 token,序列却不显示边界。作者把该划分的偏移称为 token phase(六种,与参考基因组比对无关);反向互补会改变 token 及其顺序,生成区嵌在更长序列中时起点也不知道。
    • 现有不足:作者称一次插入或删除会改变其后每个 token,以及决定标记位的密钥上下文;没有留下可对齐的 token 序列,固定词表划分也帮不上。验证者必须搜索这些可能性,并控制整条序列的假阳性。
    • 本文做法:把 SynthID tournament 水印嵌入 Carbon-500M 与 GENERator-v2。验证者搜索两条链、每个起点和四种窗口长度,并对整次搜索做一次校正决策。作者称不提出新的水印构造。
    • 威胁模型:
      • 决策:判断该密钥下序列是否带生成时水印,整条序列只给一个答案。
      • 验证者持有:序列、密钥,以及已公布设置(生成域标签、四种窗口长度、30 层锦标赛、四 token 上下文、1,024 上下文重复历史、α=0.01)。作者称部署时只有密钥是秘密。
      • 验证者没有:prompt、模型或其概率、seed、链、token phase、生成边界。
      • 本实验的编辑:固定伪随机规则放置,从不查阅验证者。作者称未测更强或自适应攻击者的规避、密钥恢复和伪造,也不表示对看见检测器的编辑者鲁棒。
  2. 有哪些相关研究?

    作者沿用SynthID,并把六碱基token下的链、相位和窗口搜索当作要处理的同步问题。

    作者按设计 DNA 水印、语言模型水印和基因组分词三组讨论前人工作,并明确不提出新构造。

    设计 DNA 的水印

    • Gibson 等(2010)在合成细菌基因组中放入水印序列;Arita 与 Ohashi(2004)在改造的 Bacillus subtilis 中写入短签名。
    • DNA-Crypt 把信息藏在同义密码子中;Liss 等(2012)把不改变编码蛋白的信息放在开放阅读框,并在病毒复制中保持。作者称这些设计需要载荷位置,并要顾及每次改动的生物学效应;生成时水印不需要载荷区。

    语言模型输出水印

    • Kirchenbauer 等(2023)偏置伪随机 token 子集并检测其过量;作者称这类方案扭曲采样,且通常在已知边界下验证。
    • 另一类在新鲜密钥随机性上期望保持输出分布,包括 Kuditipudi 等(2024)按编辑距离对齐到密钥序列,以及 Christ 等、Hu 等、Wu 等的方案。SynthID 的非扭曲配置属于这一类;Dathathri 等(2024)给出其二进制锦标赛。
    • 文本侧把同步当作局部问题:Kirchenbauer 等搜索连续片段并校准该搜索的假阳性;Golowich 与 Moitra 用伪随机码容忍一定比例的对抗编辑;Zhao 等用固定划分应对位置偏移。作者称六碱基 token 去掉了这些方法依赖的局部性。先前工作描述了规避、密钥恢复和伪造,作者称本研究都不测。

    基因组分词与生物序列水印

    • 本文两模型把 DNA 分成互不重叠的六碱基 token。一个碱基一个 token 的模型没有相位问题;Caduceus 选用单碱基 token,因为小改动否则会大幅改变分词。GENERator 随机化训练样本的分词偏移,GENERator-v2 轮换六个偏移。作者称这些补救对只收到 DNA 的验证者不可用。
    • Zhang 等的水印假定编码区,Chen 等标记蛋白质而非其 DNA。作者称本文评估的构造不需要模型、比对、已知边界或编码区,并在期望上保持采样分布。

    基线与定位

    • 基线方法是同一模型、同一 4,096 token 限制下的普通采样器;数据是 16 条 RefSeq 染色体记录上的前向链窗口,分成开发队列与检测队列。作者写明没有在同一队列上与另一种水印构造比较。
    • 作者称贡献是这套共享的嵌入与检测流程:搜索链、相位、起点和窗口长度,并把对该搜索的校正算作方法的一部分。选择 SynthID 是因为它结合局部密钥与锦标赛采样,且已在大规模文本部署中评估过。
  3. 论文如何解决这个问题?

    采样时用30层锦标赛重加权;验证者搜索两条链、全部起点和四种窗口,再做一次序列决策。

    作者不改水印构造,在采样时嵌入 SynthID tournament,再用 位置无关检测 在未知边界下搜索。

    采样与嵌入

    • 两个 decoder-only 模型:Carbon-500M 与 GENERator-v2-eukaryote-1.2b-base。每步把 logits 限制在 4,096 个规范 DNA token 并归一化一次。GENERator 使用直接 token 分布,不用其发布代码默认的逐碱基采样。温度 1.0,无 top-k 或 top-p。两模型分开报告。
    • 普通采样器从分布 p 抽取。带标记采样器用密钥、前四个 token 和候选 token,经 HMAC-SHA-256 得到标记位 g。一层重加权为 p′(x)=p(x)(1+g(x)−∑y p(y)g(y)),标记位为 1 的候选按这类候选的总概率增加概率。
    • 采样器施加 m=30 层,每层有自己的标记位,再从所得分布 pk 采样。前四个生成 token 普通采样,使后来的上下文能只从续写重建。已出现过的四 token 上下文也普通采样,并排除出检测分数;采样器保留 1,024 个上下文的历史。作者称对新鲜密钥函数取平均时,该式不改变下一 token 分布;固定密钥和上下文时,采样器遵循 pk。Figure 1a 是示意,不是测量。

    位置无关检测

    • 验证者收到序列、密钥和已公布设置,不收到 prompt、模型概率、seed、链、相位或生成边界。它在序列及其反向互补的每个起点上,对长度 384、768、1,536、3,072 碱基的窗口计分,从而覆盖六个相位。Figure 1b 标出这四种长度分别有 3,073、2,689、1,921、385 个起点;3,456 碱基序列共 16,136 个窗口。
    • 窗口从第一碱基切 token,前四个只供上下文。此后上下文非重复的 token 为计分 token。零假设下标记位像独立公平硬币,窗口 P 值为 S 个 1 在 n 个标记位中的二项上尾。序列决策为 Pseq=min(1, M·min Pwin),不超过预先设定的 α=0.01 则为阳性。强度是 −log10 Pwin,阈值 log10(M/α)=6.21。编辑改变长度时重算 M。
    • 作者称 Bonferroni 不要求检验独立,但这里偏保守:同长度、起点相差 6 的倍数的窗口共享相位和几乎全部 token。窗口不必完整;丢失相位或上下文的 token 只稀释计数。最短窗口至多 60 个计分 token、1,800 个标记位,全部计分时至少 1,004 个为 1,约 56%(Supplementary Section S2)。

    提示词、队列与分数

    • 提示是八个模式生物、16 条 RefSeq 染色体记录上的 384 碱基前向链窗口,由固定标签、登录号和片段索引哈希选取。排除人类、患者、受控访问、细胞器、质粒和含混碱基区段。队列在任何模型生成前固定,之后不增删提示。
    • 开发队列 256 条:查看任何检测结果前,64 条用于选择如何汇总窗口内标记位,192 条留出。采样器检查和序列指标只用该队列。检测队列 1,608 条,来自 12/16 条记录、六个生物(不含小鼠和出芽酵母),每条记录 134 个不重叠窗口;64 条未用,1,544 条留出。检测队列用单独的生成域标签,其余设置相同。
    • 每条提示、每个模型生成两条带标记和两条普通续写,各 512 token(3,072 碱基),两种子;两次带标记抽取用不同且已公开的密钥。提示接在留出续写前,得到验证者看到的 3,456 碱基序列。用另一次带标记抽取的密钥计分,构成错误密钥对照。三种比率分开报告。
    • 窗口分数在保留的 64 条上、已知相位时比较 SynthID 均值与加权均值,选了均值,未拟合信号匹配权重。作者称该选择只对 GENERator 有独立保留结果,Carbon 的对应比较只在运行笔记中。

    检查、编辑与指标定义

    • 采样器正确性依赖实现测试:锦标赛更新在若干分布上复现 SynthID-Text 公开参考;向量化 pk 与独立实现在浮点精度上一致;一次算出 pk 再做逆 CDF,能精确复现生成采样器的抽取。另在开发队列每个提示的普通续写第 64 个 token 处,从 p 与 pk 各抽 5,000 次,用似然比对照蒙特卡罗零分布。
    • 单碱基条件在续写中恰好替换、插入或删除一个碱基。编辑率实验令 k=round(3,072 r),r 取 0.03% 到 10% 的七个值;每次插入或删除增减 1 至 5 个碱基,编辑率按事件而不是改变的碱基数计算。四组序列把反向移框分开。位置不查阅检测器。
    • 模型分数是同一模型、同一 token 限制下、以提示为上下文的 teacher-forced 每 token 负对数似然,不在模型之间比较。另有 13 项预先指定序列指标,与模型分数共 14 项,作为一族做 Benjamini–Hochberg 校正。提示是独立单位,两次抽取是配对重复。
  4. 论文做了哪些实验?

    两模型在1,544条保留提示上找回全部3,088条带标记序列;普通序列假阳性上界至多0.850%。

    两模型在留出的检测队列上做位置无关检出,并用普通序列与错误密钥看假阳性。

    实验设置

    • 模型:Carbon-500M 与 GENERator-v2 1.2B(GENERator-v2-eukaryote-1.2b-base)。对照是同一模型的普通采样器,不是另一种水印。没有 LLM 评审。
    • 队列:开发队列 256 条提示(64 条选分数形式,192 条留出)。检测队列 1,608 条,1,544 条留出;来自 12 条 RefSeq 记录、六个生物,不含小鼠和出芽酵母。每条提示、每个模型两条带标记加两条普通续写,各 3,072 碱基;测试序列 3,456 碱基。
    • 阳性:强度达到 6.21,即 Pseq≤0.01,M 在未编辑的 3,456 碱基序列上为 16,136。带标记提示要求两次抽取都检出;对照提示任一次阳性即计为阳性。
    • 假阳性:生成前写定的计划报告 1,544 条留出提示上的 Clopper–Pearson 精确单侧 95% 上界。普通序列是主要对照,错误密钥是次要的密钥特异性检查。开发队列用精确双侧 95% 区间。
    • 编辑:单碱基替换、插入或删除;以及每碱基 0.03%、0.1%、0.5%、1%、2%、5%、10% 的替换、仅插入、仅删除、混合插删。位置不参考检测器。编辑率系列没有错误密钥对照,每模型、每速率、每系列 3,088 条序列。
    • 质量与采样器:14 项指标在开发队列上比较;配对符号翻转 100,000 次,按提示等权自助 20,000 次。采样器在每条开发提示的第 64 个 token 处各抽 5,000 次。检测队列由同一作者、同一代码在另一计算环境生成,密钥函数是新的。

    主结果

    表格较宽,可左右滑动

    模型编辑正确密钥普通序列(上界)错误密钥(上界)
    Carbon-500M无3,088/3,0883(0.501%)5(0.680%)
    Carbon-500M一次替换3,088/3,0883(0.501%)5(0.680%)
    Carbon-500M一次插入3,088/3,0883(0.501%)6(0.766%)
    Carbon-500M一次删除3,088/3,0884(0.592%)9(1.015%)
    GENERator-v2 1.2B无3,088/3,0885(0.680%)2(0.407%)
    GENERator-v2 1.2B一次替换3,088/3,0885(0.680%)2(0.407%)
    GENERator-v2 1.2B一次插入3,088/3,0886(0.766%)2(0.407%)
    GENERator-v2 1.2B一次删除3,088/3,0887(0.850%)3(0.501%)

    据 Table 1。正确密钥列是序列数,分母为每种条件 3,088。对照列是阳性提示数,括号是提示级比率的精确单侧 95% 上界。

    • 作者称四种条件下全部带标记提示都被检出;该提示级检出率的精确双侧 95% 区间为 99.76–100%。
    • 作者称普通序列的每个上界都低于预先指定的 1% 目标。计划写明,上界低于 1% 至多对应 8 个阳性提示。
    • 错误密钥有一格越过该目标,见表中 Carbon、一次删除。作者称拿提示级比率与 1% 比较是保守的,因为提示级比率约为 α 所控制的每序列比率的两倍。

    质量代理与采样器

    • 测了开发队列 256 条提示、512 对匹配续写上的 14 项指标。Figure 2:Carbon 模型分数差为 +0.00852 nats/token,区间 −0.04426 到 +0.05973,P=0.75;GENERator 为 −0.00564,区间 −0.05614 到 +0.04378,P=0.83。每项区间都含 0。最小调整 P 为 Carbon 0.85、GENERator 0.73。最大绝对标准化效应为 Carbon 最长单碱基游程 0.084 个标准差,GENERator 平均单碱基游程 0.111。作者称在这些代理上没有可测到的质量损失。
    • 256 个状态中,P<0.05 的名义拒绝数:Carbon 带标记 13、普通 12;GENERator 带标记 5、普通 14。作者给出机会期望为 12.8。GENERator 两个采样器在 Benjamini–Hochberg 校正后都没有拒绝。Carbon 的校正后计数未与证据一并保留;作者称其名义计数接近机会水平。负对照在每模型 8 个状态上全部拒绝。作者称这支持采样器在每状态 5,000 次抽取的分辨率上正确,但不证明每个可能状态都正确。999 次重复使 Bonferroni 在这里不能拒绝。
    • 作者称两模型典型强度相近。检测队列未编辑中位强度为 Carbon 792.9、GENERator 799.7,高于阈值 6.21。开发队列最弱序列为 124.8 与 19.6;作者把 GENERator 这一条联系到高度重复的续写,并称没有证据说明典型强度不同,也未测量逐 token 熵。

    单碱基编辑后的窗口

    • 全部带标记序列仍被检出。作者称一次替换使中位强度下降约 2%,一次插入或删除约 45%。Supplementary Table S2 的中位数:未编辑 792.9 与 799.7,替换 777.6 与 783.8,插入 441.8 与 443.1,删除 437.7 与 438.5(Carbon 在前)。
    • 完整 3,072 碱基窗口为最强的条数,分母 3,088:未编辑与替换均为 Carbon 3,087、GENERator 3,085;插入为 1,724 与 1,732;删除为 1,663 与 1,671(Table S2)。
    • 作者称替换保持下游 token phase,插入或删除会移动跨越编辑点的窗口中其后每个 token 的划分。较短窗口被选中,与搜索找到 phase 被保持或恢复的区段一致;最强窗口不标识确切生成边界。

    累积随机编辑

    • Figure 5:至 2% 每碱基(61 次编辑/3,072 碱基续写),每种编辑类型的带标记序列都被检出,除混合系列在 2% 时 1 条 GENERator 序列。作者称两模型曲线在每个速率和编辑类型上相差不超过 1 个百分点,因此这一条并不表示二者鲁棒性不同。
    • 5% 时,替换仍检出全部 Carbon 序列和除 1 条外的全部 GENERator 序列;插入和删除后的检出降到 92.9–93.9%。10% 时,替换检出 Carbon 的 19.7%、GENERator 的 18.7%,其余编辑类型为 4.6–5.9%。作者称插入和删除在更低速率上就使验证失败;仅插入与仅删除系列表现类似混合系列,因此反向移框相互抵消解释不了这一容忍。
    • 普通序列在每个速率、每个系列都低于 1% 目标。单格最大为 0.29%,是 GENERator 混合系列在 1%。Section 4.5 汇总为普通 Carbon 0.15%、GENERator 0.13%,该句未给分母。Figure 5 注:含未编辑、跨全部速率和编辑类型,132/89,552 条 Carbon 与 116/89,552 条 GENERator 为阳性。

    其他消融与分析

    • 四种条件合并的每序列校正后阳性:普通 Carbon 0.105%,普通 GENERator 0.186%(Section 4.3)。
    • 开发队列:每种条件带标记 384/384;对照至多 1 条阳性序列。192 个提示时,1 个阳性提示的精确双侧区间可达 2.868%(Table S1)。删除后 GENERator 错误密钥为 0/384。
    • 开发队列中完整 3,072 窗口为最强的条数,分母 384:Carbon 未编辑/替换/插入/删除为 383、383、203、232;GENERator 为 381、381、200、227(Table S2)。
    • 已知相位的诊断只做了 GENERator:四种长度下普通提示阳性数为 2、6、6、4,各长度期望约 5,P=0.25–0.87(S7)。
    • 搜索耗时:3,456 碱基单线程中位 0.0956 秒,6,912 碱基 0.245 秒,13,824 碱基 0.902 秒;16 进程壁钟 0.0167 秒/序列(S4,AMD EPYC 7763)。
    • 矩匹配下,最小窗口 P 值像约 828–852 个独立检验;作者称实现的假阳性比 α 低 9.5 倍(Carbon)和 5.4 倍(GENERator)(S3)。
  5. 有什么可以进一步探索的点?

    作者称更广结论需要独立复制、更宽序列覆盖、自适应编辑测试和生物学验证。

    下面先列作者写出的局限和后续方向,再列论文实际报告的实验范围。

    作者指出的局限与后续方向

    • 没有一般性证明:评估只覆盖两个模型、一种水印构造和一个验证者,作者称没有水印鲁棒性、生物学安全或密钥安全的一般证明(Section 6)。
    • 分词与来源:两模型都用六碱基 token;单碱基或变长 token 会带来不同的对齐问题。两个队列来自同一 16 条染色体记录或其子集,作者称这限制向其他基因组来源外推;更长序列会增大搜索校正(Section 6)。
    • 非独立与文档:模型不独立,因为 Carbon 训练集主要建在 GENERator-v2 的预训练数据上;一致并不使它们等价。检测队列不是独立复制。Carbon 的协议文档与开发队列结果中的哈希不一致,原文档无法恢复;1,024 上下文重复历史只依赖检测器代码默认值。作者称这不表示所报告的序列或检测统计不同,但执行无法对照该文档核对(Section 6)。
    • 假阳性:作者称假阳性证据窄。192 条提示的开发队列不能显示比率低于 1%。检测队列普通序列上界都低于 1%,但最大的 0.850% 只是勉强低于;Carbon 删除后的错误密钥上界为 1.015%。这些比率适用于所测长度和来源,别处只靠 Bonferroni(Section 6)。
    • 密钥与攻击:密钥为可复现而公开,未评估保密、抗密钥恢复和部署中的去除。分析零假设是没有正确密钥时标记位为独立公平硬币。作者列出未测的文本水印攻击,包括由检测器 P 值恢复密钥、对 SynthID-Text 的改写和回译,以及影响均值分数的 layer-inflation(Section 6)。
    • 后续测量:似然和序列统计不是表达、复制、功能、存活性或安全;质量主张只覆盖 14 项指标。作者称更广结论需要独立复制、更宽序列覆盖、针对自适应编辑的测试和生物学验证(Section 6、Conclusion)。最短可检出续写,以及锦标赛深度上检测力与失真的权衡,仍待在两模型上测量;与同义密码子水印结合也需要单独评估(Discussion)。

    实验覆盖范围

    • 被测生成模型为 Carbon-500M 与 GENERator-v2-eukaryote-1.2b-base。检测队列报告 1,544 条留出提示、每提示两次抽取,即每种条件 3,088 条序列(Table 1)。
    • 编辑为续写中恰好一个替换、插入或删除,以及 Figure 5 的七档每碱基编辑率和四组随机系列;位置不参考检测器(Section 3.7–3.8)。
    • 质量比较在开发队列 256 条提示上,包含模型分数和 13 项预先指定序列指标(Section 3.6、Figure 2)。窗口分数形式的独立核对,论文写明只针对 GENERator(S1)。
    • 对照是匹配的普通采样器。论文写明未在同一队列上比较另一种水印构造,例如改到六碱基 token 的 biased-logit 方案(Section 6)。
    • 论文未报告独立复制、看见检测器后的自适应编辑、编辑率系列的错误密钥对照,以及表达或功能实验;Carbon 采样器在多重校正后的拒绝数也未保留(Section 4.1、Section 6)。
  6. 总结一下论文的主要内容

    两个六碱基基因组模型嵌入SynthID后,位置无关验证能找回水印,作者称这只是统计检测。

    作者在两个六碱基基因组模型的采样里嵌入 SynthID,并让验证者在不知道起点、链和 token phase 时做一次校正后的检出。

    • 问题:生成的 DNA 不记录来源。验证者只有序列、密钥和已公布设置,必须自己搜索链、相位、起点和窗口长度,同时控制整条序列的假阳性。
    • 做法:Carbon-500M 与 GENERator-v2 1.2B 在 4,096 个规范 DNA token 上、温度 1.0 直接采样。带标记采样器用 30 层锦标赛重加权;前四个 token 和重复上下文不带标记。验证者对两条链和四种窗口长度计算二项尾概率,α=0.01,未编辑的 3,456 碱基序列要校正 16,136 个窗口。
    • 检出:检测队列 1,544 条保留提示上,未编辑以及一次替换、插入或删除后,两模型的正确密钥都是 3,088/3,088(Table 1)。提示级检出率的精确双侧 95% 区间为 99.76–100%。未编辑中位强度为 Carbon 792.9、GENERator 799.7,阈值 6.21。
    • 假阳性与质量:普通序列的单侧 95% 上界最高 0.850%(GENERator,一次删除)。错误密钥有一格为 1.015%(Carbon,一次删除)。开发队列 14 项指标的区间都含 0;模型分数差的 P 为 Carbon 0.75、GENERator 0.83。
    • 随机编辑:至 2% 每碱基(61 次/续写),作者称检出仍完整或接近完整,仅混合系列 1 条 GENERator 漏检。10% 替换的检出为 Carbon 19.7%、GENERator 18.7%;其余编辑类型为 4.6–5.9%。
    • 作者的结论:这是统计检测,不是生物学功能、密钥安全,或对看见检测器的编辑者的鲁棒性。更广结论需要独立复制、更宽的序列覆盖、自适应编辑测试和生物学验证。
阅读原文arxiv.org