攻击arXiv 2609.24994
BAM 反馈编码实现推理时隐蔽的智能体通信
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷
- arXiv
- 2609.24994
- 发表
- 层
- 模型层
- 场景
- 多智能体
- 攻击者
- 黑盒
- 测试
- Llama-3.1-8B、Qwen-3.5-9B-Base、Mistral-7B-v0.3 等 6 个
提出变长反馈编码 BAM,在生成文本中隐蔽传输秘密载荷
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印
DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。