防御arXiv 2610.02817
RMCW:基于 Reed-Muller 码的抗删除 LLM 水印方法
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
- arXiv
- 2610.02817
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- OPT-1.3B、Llama-3.1-8B-Instruct
另有 47 篇论文还没打上分类标签,暂不在筛选结果里。
提出抗删除水印 RMCW,在生成时注入 Reed-Muller 结构并做局部检验
提出 SecOPD 同策略蒸馏微调,降低模型对自适应提示注入的顺从
提出 ClawSentry 渐进式多层监控网关,拦截恶意技能包与上下文注入
ClawSentry 是挂在智能体运行时之外的安全监督网关,用来同时盖住 skill 执行的多个生命周期边界,并把已被拒绝的效果记到会话里。
提出 Safin-1,以可路由 Safety State 在冻结主干上实现内在安全
提出 ARIA,在冻结权重上用 SAE 做推理时遗忘门控
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
提出 RAPID,离线把抗蒸馏扰动写入文生图解码器