研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
- arXiv
- 2610.05453
- 发表
- 场景
- 模型与 API
- 被测模型
- OmniGen2、BAGEL-7B
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
提出 PLW,用微调把先前对话敏感触发编码进后续生成图像
摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。
检验低监控读数能否证明代码生成中的奖励作弊已受控
本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。
这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。
提出 CATCH 测试台,复现编码 RL 的奖励作弊
CATCH 是面向编码 RL 奖励黑客的可控分析测试床,用可利用环境、可调初始倾向和基于执行的金标签,在训练全程比较黑客动态与干预。
提出 BadAction,通过动作触发器给交互式视频生成植入后门
用持续更新的探针做微调,降低有害性并保持线性可监测性
Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。
提出 IDU,在无保留样本时蒸馏单步生成器并抑制遗忘子集
IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。
提出跨架构攻击 CSR,用概念分数参数重学习恢复文生图被擦除概念
提出 SGA-Flow-GRPO,用奖励梯度调制文生图模型的 token 级优势
提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊
HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。