SeqWM:面向 LLM 智能体的序列行为水印框架
Sequential Behavioral Watermarking for LLM Agents
SeqWM把水印写入动作转移并用随机密钥检测;Table 2上p为0.001或0.010。
检测器持有密钥K与观测动作序列,判断序列是否来自带水印源。
- 智能体动作轨迹难以说明由谁产生,文本水印又抓不住动作级决策。按轮次索引的行为水印在删除、截断或无法对齐时容易错位。
- SeqWM以最近动作窗口经HMAC生成多通道引导子集,并对动作分布做指数倾斜。检测滑窗计分,用错误密钥构造经验p值,不依赖绝对轮次。
- ToolBench、ALFWorld、OASIS与三个开源骨干上,SeqWM的p为0.001或0.010(Table 2)。作者称随机删除下它比轮次索引基线更稳,并称效用保持,但未给效用数值。
- 作者将自适应攻击、替换、语义改写式轨迹编辑,以及更紧的多通道分析列为后续。实验覆盖三个开源骨干、三个基准和随机删除;未报告重复次数与效用数值。
- 威胁模型
- 检测器持有密钥K与观测动作序列,判断序列是否来自带水印源。观测可完整或被破坏;分析主要将破坏建模为任意位置删除,故T′≤T。Theorem 4.1假定验证方能重建每个被评分转移的候选动作集。
- 被测模型
- LLaMA-3.2 3B InstructGemma 4 E4B-itQwen3-4B Instruct
- 基准
- ToolBenchALFWorldOASIS Reddit
- 指标
- z-scorep-valueHit%TPR
研究者提出 SeqWM,一种面向 LLM 智能体的序列行为水印框架,将水印信号嵌入由历史条件决定的转移模式中,并以位置无关的方式对照随机密钥基线验证轨迹。作者指出,已有智能体水印方法把每个动作步骤当作独立试验,忽略轨迹结构,在轨迹被扰动、截断或缺乏可靠对齐时容易失效。在多种智能体基准和 LLM 基座上的实验显示,SeqWM 在保持智能体效用的同时实现可靠检测,并在轨迹损坏情形下仍保持稳健,而按轮次索引的行为水印在此类情形下会失效。
深度解读
这篇论文试图解决什么问题?
动作轨迹难溯源;SeqWM把水印写入历史条件转移并做位置无关检测。
观测到的智能体动作序列,提供不了它由哪个智能体或策略产生的证据。
- 场景:作者称知识产权已转到昂贵后训练得到的决策能力,轨迹本身也是资产。作者引述的成本包括单条SWE-Bench风格轨迹量级约100美元、工具使用对话约8美元,以及120任务的Mind2Web 2超过1000小时人工。同一判定还关系到冒充、协同操纵、内容归因,以及经普通API采集轨迹后训练替代模型。
- 文本水印对不上动作:密钥把采样偏向词表子集。作者认为一个高层动作由许多token实现,偏置主要改句法表面;验证时内部token又常常不可见。作者引用对29个商业智能体平台的调查:82.8%只暴露最终动作流。闭源预训练API也不能把信号写进权重。
- 已有行为水印的缺口:按步偏置、改轨迹或利用等价工具路径,证据仍绑在单步决策、触发动作或固定执行选择上。以绝对轮次播种时,删除、截断或缺少可靠对齐会使后续指示与密钥子集错位。
- 本文做法:把行为水印看成序列编码。生成可沿动作历史链式条件化,验证则不必重建整条链。SeqWM把信号写入历史条件转移,并做位置无关、随机密钥校准的检测。
- 威胁模型:
- 判定目标:检测器判断观测是否来自带水印源。
- 共享知识:编码器与检测器共享密钥K;检测器还收到动作序列。
- 破坏:观测可完整;分析中的破坏主要是任意位置删除,因而T′≤T。实验另测随机动作删除。
- 验证前提:Theorem 4.1假定验证方能重建每个被评分转移所用的候选动作集。
有哪些相关研究?
行为水印已有按步偏置与轨迹钩子;SeqWM改为历史条件转移与位置无关验证。
论文按文本水印、其限度,以及智能体行为水印来组织相关工作。
- 文本水印:Kirchenbauer等(2023)用密钥伪随机函数划分绿/红词表并偏置采样,以z统计做零比特检测。后续低失真或分布保持方案包括Aaronson(2022)、Christ等(2024)、Kuditipudi等(2024),以及Dathathri等(2024)的SynthID-Text。语义条件化方案包括Liu等(2024)与Hou等的SemStamp(2024)。论文称这些方法为生成文本提供溯源,但不直接适用于证据常为离散、部分可观测动作轨迹的智能体。
- 限度与其他溯源:Kirchenbauer等(2024)考察编辑与长度变化下的检测;Jovanović等(2024)讨论从输出近似水印规则并做伪造与擦除;Pang等(2024)分析鲁棒性、效用与抗去除、抗伪造的权衡;An等(2026)的DITTO讨论蒸馏后学生模型继承水印。指纹(Xu等,2024;Russinovich等的Chain & Hash,2026)和代码数据水印(Sun等,2022、2023)验证的是文本、问答、代码或模型行为。论文称这些设置不直接处理智能体动作轨迹。
- 智能体水印:Huang等(2025)的AgentGuide对每步有限行为列表的密钥子集加偏置,用单侧z检验相对二项零假设检测。附录B称它会改逐步概率,分布代价可能沿长程累积。Huang等(2026)的AgentMark在保持逐步引出分布的前提下嵌入多比特标识,并用擦除恢复处理部分轨迹。Meng等(2026)的ActHook在高熵决策点注入由秘密激活短语触发的钩子动作,再用与假触发配对的假设检验验证。Wang等(2026)的AgentWM在grey-box下只见动作序列和最终响应时,于语义等价的工具路径之间加偏置。论文称这些工作多把证据当作逐步信号或结构化载荷。
- 基线与基准:实验对照为Unwatermarked、AgentGuide、AgentMark。基准为ToolBench、ALFWorld、OASIS Reddit。
作者将SeqWM定位为:信号放在历史条件转移模式中,验证是位置无关、经随机密钥校准的检测。
论文如何解决这个问题?
三组件把信号写入条件转移,滑窗聚合,再用错误密钥得到有限样本p值。
SeqWM把水印从边际动作频率改到历史条件转移:多通道编码写入信号,滑动窗口去掉绝对步号,随机密钥给出不依赖指示独立的p值。
设定与密钥子集
- 智能体与环境交互T步。第t步从有限候选集Bt选动作bt,|Bt|=A。正文为简化把A当作常数;集合大小变化时改用At,零假设命中率p0,t=n/At。
- Pt是无水印时引出的动作分布,Ptwm是加水印后的分布。编码器与检测器共享密钥K。
- 对字节串x,GK(x)用HMAC(K, x)从Bt抽取大小为n的子集。作者把不同上下文上的GK理想化为独立、均匀的随机n-子集。
历史条件多通道编码
- 轮次索引方案用绝对步号t播种。SeqWM改为窗口ct=(bt−w,…,bt−1),引导子集Bg,t=GK(ct)。作者给出的理由有二:信号进入条件转移,只匹配边际分布去不掉水印;同一窗口在流中任何位置得到同一子集,编解码不必共享绝对坐标。
- m个通道把通道号拼进种子。st(b)统计动作b落入多少个引导子集。前w步窗口未满时退回未修改的Pt。
- 加水印分布是指数倾斜。式(5)为Ptwm(b)=1/ZtPt(b)exp(γ· st(b)/m),即按st(b)/m、以强度γ倾斜Pt。作者给出的理由是它属于指数族、小γ时近似乘性偏置,且多通道同时命中的动作会被放大。实验配置在倾斜前对概率取下界δ=0.2(第5.1节、附录E.3)。
- 默认w=3、m=8、n=3,OASIS因行为集更小取n=2,γ=2.0。附录E.3另有裁剪后的最小子集大小n_min,一般为2,OASIS为1。作者由一阶展开得到和分数检测器的信噪比随sqrt((T−w)/m)与γ增长,KL二阶项约为γ² p0(1−p0)/(2m),并称二者之比与m无关。m的作用被写成局部冗余、校准更集中,以及可换成加权或似然比检测器。
滑动窗口检测
- 对观测序列的每个长w子串,检查紧随其后的动作是否落入编码器会使用的引导子集,再对位置和通道求和。检测既不知道、也不需要该窗口原来出现在哪一步。
- 作者强调一种不对称:编码链式依赖前w个动作,检测把每个长w+1子串当证据片段聚合,不必沿链重建。
- Theorem 4.1在随机删除比例ρ=d/T、且验证方能重建候选集时比较两类检测。轮次索引在首次删除之后,指示期望回到零假设命中率p0,删除后的期望分数差为O(1/ρ),相对干净序列的Θ(T)差距,在固定ρ>0且T趋于无穷时相对消失。滑窗分数满足S(K,观测)≥S(K,原序列)−d(w+1)m。作者称该界是加性的,并不直接保证删除后的检测差距;w=3时,删除至多使4ρTm个干净滑窗指示失效。证明放在附录D,并依赖伪随机错位理想化。
随机密钥校准
- 作者认为模型自身的序列依赖、相同窗口重复使用同一子集,以及重叠子串,会使指示正相关。把分数对二项零假设做z检验会低估方差、抬高假阳性。
- 对同一观测换M个错误密钥重算分数。式(12)为p=(1+#{r:Sr≥ Strue})/(M+1),p<α则判为带水印。零假设下真密钥与错误密钥可交换,故对任意α∈(0,1)有Pr[p≤α]≤α,且不要求T′、m或M进入渐近区间。
- 实验取M=1000、α=0.01。作者称该检验不依赖动作分布形式;序列被删除、截断、替换或部分观测时,p值仍然有效,检测功效可能下降。把分数换成其他由密钥与观测算出的统计量,有效性仍保留。
论文做了哪些实验?
Table 2中SeqWM的p为0.001或0.010;两基线p均不低于0.01。
实验设置
- 骨干:LLaMA-3.2 3B Instruct、Gemma 4 E4B-it、Qwen3-4B Instruct,解码温度0.7。人格固定为Agent Guide档案中的active_calm,作者称这是为把水印效应与人格方差分开。
- 基准:ToolBench,200条查询,ReAct,每回合至多6步;ALFWorld,50个任务,回合最长50,one-shot;OASIS Reddit,100个模拟步,1个用户智能体加3个NPC。
- 水印参数:除非另述,w=3,m=8,n=3(OASIS为2),δ=0.2,γ=2.0,α=0.01,M=1000。
- 对照:Unwatermarked、AgentGuide、AgentMark。脚注称AgentMark是多比特载荷水印,表中z、p不是其原生指标,仅为跨方法比较列入;其Hit%未定义。无水印行的Hit%也未定义。
- 指标:检测z、p和逐步Hit%。判定为p<α。论文未说明Table 2的z如何计算,也未说明z与p是全轨迹汇总还是按任务聚合。论文未报告重复次数。
- 其他扫描:γ取0.5、1.0、1.5、2.0、2.5、3.0,m=8。随机删除比例r取0%、5%、10%、20%、30%、50%。
主结果
Table 2中SeqWM的z / p / Hit%如下。
表格较宽,可左右滑动
模型 ToolBench ALFWorld OASIS Gemma 7.77 / 0.001 / 67% 9.45 / 0.001 / 66% 4.67 / 0.001 / 99% LLaMA 9.22 / 0.001 / 81% 10.18 / 0.001 / 75% 5.16 / 0.001 / 100% Qwen 5.48 / 0.001 / 63% 11.44 / 0.001 / 79% 2.53 / 0.010 / 97% - 作者称SeqWM是唯一在所有设置下能可靠拒绝零假设的方法。按正文的p<α且α=0.01,上表八格p=0.001,Qwen–OASIS为0.010,并不严格小于0.01。
- Table 2中AgentGuide的p最低为Gemma–ToolBench的0.032,最高为Qwen–ALFWorld的0.985;AgentMark的p最低为Qwen–ALFWorld的0.087。两行都不低于0.01。无水印行的p在0.416到0.830之间。
- 作者称序列级检测可以在逐步命中率只是中等偏高时出现,并认为信号来自许多弱的转移偏置累积。表中SeqWM的Hit%为63%–100%,AgentGuide为17%–49%。其中LLaMA–OASIS的AgentGuide Hit%为49%,但z=−1.06、p=0.861。
偏差强度
- 第5.2节与Figure 2称在OASIS Reddit、三个骨干上扫描γ。图注称多通道检测随偏置单调增强,并在每个骨干上越过最严阈值;单通道消融一直处于噪声底部。正文称自γ=2.0起三骨干均p<0.01,单通道在γ=3.0仍接近零假设。正文未给出各γ的z读数。
- 第5.1节与附录E.4则写该扫描在50条ToolBench子集上、m=8,并为每个γ同时生成无水印与多通道轨迹。两处对数据集的写法不同。作者把默认γ定为2.0,称这是各骨干上都能检出的最小值。
- 作者称检测并不只来自偏置强度,还需要跨通道冗余和位置无关的序列检测器。Table 2的Qwen–OASIS p=0.010,与第5.2节“自γ=2.0起p<0.01”并不相同。
随机删除
- 删除比例为0%、5%、10%、20%、30%、50%,然后检测。作者称这同时对应部分日志,以及试图破坏轨迹溯源的对抗尝试。
- 作者称AgentGuide在较小删除率后失效,因为缺一个动作就会使下游密钥子集错位;单通道变体避免这种全局错位,但分差太小,经不起较大破坏。
- 作者称完整多通道SeqWM在三域的中等删除下保持稳定:小删除率下接近无删除时的检测,删除率升高后逐步变差,而不是一次失效。Figure 3的文字未给出各点TPR;图注称颜色区分方法,线型区分FPR阈值。
均值偏移校验
- Table 1给出一阶预测ΔSpred、实测ΔS与比值:ToolBench为193.0、216.8、1.12;ALFWorld为348.5、318.1、0.91;OASIS为43.8、62.4、1.42。作者称在γ=2.0下与预测相差一个小的常数因子,偏差与O(γ²)修正一致。
- 无水印序列上,实测gap至多为E[S]的1.74%,三个域都如此。作者称随机密钥校准给出无偏的零假设估计。
其他消融与分析
- 作者称普通和分数检测器下,信噪比平方与KL之比不随m提高;m的好处是局部冗余、校准集中和可换检测器。正文未给不同m的检测表。
- 单通道对照出现在Figure 2与第5.3节,无逐点z表。
- 附录E.3另列参考用单通道z检验阈值2.0;主结果判定用α=0.01。
- 摘要、贡献与结论称效用得以保持;实验节与附录未给出任务成功率或效用差值。
有什么可以进一步探索的点?
作者将自适应攻击、替换与语义改写式编辑列为后续方向。
作者指出的局限与后续方向
- 更强的对抗模型,包括自适应攻击者,以及释义这类语义级变换,是行为级水印仍需面对的问题(附录A)。
- 把该视角扩展到更强的自适应攻击、替换,以及语义改写式轨迹编辑,作者写为后续方向(第6节)。
- 把多通道冗余的分析刻画收紧到已识别的三方面好处之外,作者视为理论方向(附录A)。这三方面是校准集中、鲁棒缓冲和检测器可扩展性。
- 作者把上述扩展写成开放方向,并写明不把它们看作当前构造的缺陷(附录A)。
实验覆盖范围
- 骨干为LLaMA-3.2 3B Instruct、Gemma 4 E4B-it、Qwen3-4B Instruct,温度0.7,人格active_calm(第5.1节、附录E.1)。
- 基准为ToolBench 200条查询、ALFWorld 50个任务、OASIS Reddit 100个模拟步;γ扫描子集在附录E.4中为50条ToolBench查询(第5.1节)。
- 对照为Unwatermarked、AgentGuide、AgentMark;删除比例为0%到50%六档,覆盖三个域(第5.2–5.3节)。
- 检测使用M=1000、α=0.01。论文未报告重复次数,实验节也未报告效用数值。
- γ扫描的数据集在第5.2节、Figure 2与第5.1节、附录E.4中写法不同。第3节把分析中的破坏主要建模为删除;Theorem 4.1假定能重建候选动作集。
总结一下论文的主要内容
SeqWM以条件转移嵌行为水印;Table 2的p为0.001或0.010。
SeqWM是给LLM智能体动作序列加水印的框架,用来在只看到动作时判断轨迹是否来自持有密钥的带水印源。
- 问题:文本水印作用在token上,对不上智能体的动作级决策,部署时内部token也常常不可见。已有行为水印多看单步选择或以绝对轮次播种,轨迹被删、截断或无法对齐时,后续核对会错位。
- 方法:用最近w步动作经HMAC生成m个引导子集,按通道命中数对引出分布做指数倾斜;窗口未满的前w步不加水印。检测对观测序列滑窗累计命中,不使用绝对步号。p值来自同一观测上M个错误密钥的分数,零假设下有限样本有效。默认w=3、m=8、γ=2.0、α=0.01、M=1000。
- 主结果:Table 2中,三个骨干与ToolBench、ALFWorld、OASIS上,SeqWM的z从Qwen–OASIS的2.53到Qwen–ALFWorld的11.44,Hit%从63%到100%,p为0.001或0.010。同表AgentGuide、AgentMark的p均不低于0.01。Table 1的偏移实测/预测比为0.91到1.42;无水印gap至多为E[S]的1.74%。
- 删除与效用:作者称随机删除下,轮次索引检测会因一个缺失动作而整体错位,多通道滑窗则把损失留在局部窗口。作者称效用保持,实验节未给效用数值。
- 作者结论:序列结构可以作为溯源载体,破坏应只造成局部证据损失。自适应攻击、替换和语义改写式轨迹编辑被列为后续方向。