摘要通过去噪中间概率反馈动态调节残差流转向,证明扩散语言模型在推理服务栈中存在闭环偏见注入脆弱性。
- 防御arXiv 2610.02817
RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
- arXiv
- 2610.02817
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 评测与基准arXiv 2607.24177
EXE-Bench:为真实可用性对 AI Windows 恶意软件检测器进行权衡排名
提出 EXE-Bench 比较 Windows 恶意软件检测器的可用性权衡
- arXiv
- 2607.24177
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 攻击检测规避
摘要统一四指标后,手工特征的 EmberGBDT 综合居首,只看准确率会误导部署。
EXE-Bench 用同一设置给 AI Windows 恶意软件检测器做四指标排序,而不是只比一次测试集准确率。。
- 攻击arXiv 2609.06749
PMA 攻击:针对隐私保护 LLM 中嵌入到嵌入混淆的语义流形对齐方法
提出 PMA,用流形对齐从 E2EO 混淆向量恢复明文
- arXiv
- 2609.06749
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.36372
TTMark:超越单 token 熵的成对无失真水印
提出成对无失真水印 TTMARK,增强低熵下的机器文本检测
- arXiv
- 2609.36372
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要TTMARK 用水印化相邻 token 对利用条件熵,在多种无失真方案上提高检测并保持生成质量。
TTMARK 是一种成对、无失真的文本水印:对相邻 token 的联合分布重加权,而不是逐 token 独立重加权。
- 防御arXiv 2608.12713
互补 LLM 水印如何追踪来源并检测篡改
提出 Cocktail 水印,共嵌稳健与脆弱信号以溯源并发现篡改
- arXiv
- 2608.12713
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 防御arXiv 2609.14257
DenMark:面向扩散语言模型的鲁棒语义水印
提出 DenMark,在扩散语言模型去噪时注入可抵抗保义编辑的语义水印
- arXiv
- 2609.14257
- 发表
- 层
- 模型层
- 场景
- 模型与 API
摘要DenMark 用 rollout 在 DLM 去噪中累积语义水印,扫描检测以抵抗保义编辑。
DenMark 是面向扩散语言模型的语义水印:在去噪的局部更新里注入密钥相关语义信号,并在编辑改变 token 边界后仍检测。现有句子级语义水印要先完成整个语义单元再打分取舍,而 DLM 以任意顺序更新掩码,中间单元不完整。DenMark 把续写划成固定 token 区域,对每个局部候选做不提交的 rollout 补全,按语义分 gb 的平均选择更新,从而沿轨迹累积证据。
已经到底了