防御arXiv 2610.02817·10月5日RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验arXiv2610.02817发表10月5日层模型层场景模型与 API测试OPT-1.3B、Llama-3.1-8B-Instruct防御水印与溯源攻击检测规避深度解读完整解读
防御arXiv 2608.21500·8月22日SecOPD 用同策略蒸馏把自适应提示注入攻击成功率降至 9.0%提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从arXiv2608.21500发表8月22日层应用层场景AI Agent测试Qwen3.6-27B (Undefended)、Meta-SecAlign、SecOPD防御模型加固攻击提示注入深度解读完整解读