跳到正文
10月9日 · 周五

全部论文

找到 9 篇
筛选5
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 538 篇还没打标签,不在筛选结果里。

另有 538 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 攻击arXiv 2610.05453

    研究者提出 Privacy-Leaking Watermarks,可在本地多模态模型中泄露对话隐私

    提出 PLW,用微调把先前对话敏感触发编码进后续生成图像

    发表
    被测模型
    OmniGen2、BAGEL-7B

    摘要PLW 把先前对话线索写成后续图像中的隐水印,检出随触发、模型和间隔变化。

    深度解读完整解读
  2. 防御arXiv 2610.02967

    用偏好奖励与评分标准奖励组合后训练前沿文生图模型

    组合偏好奖励与评分标准奖励后训练文生图模型以抑制奖励作弊

    发表
    被测模型
    FLUX.2-dev、Ideogram-4
    摘要组合奖励后训练 FLUX.2-dev 与 Ideogram-4,并报告高于基座的胜率与 Elo。

    作者给出一套开放域文生图后训练配方:把人类偏好奖励和 prompt 条件的 rubric 奖励合在一起,而不是换一个新优化器。问题是单一奖励盖不住用户意图。偏好模型能看整体观感,但对“是否实现每个要求”这类稀疏属性不敏感。

    深度解读完整解读
  3. 风险行为arXiv 2610.03458

    论文:低监控读数不能证明行为受控

    检验低监控读数能否证明代码生成中的奖励作弊已受控

    发表
    被测模型
    Llama-3.1-8B-Instruct
    摘要论文指出监控器训练读数接近零无法确立作弊受控,模型可利用通用外壳推迟提交绕过监控,强化学习亟需带外行为验证。

    本文是一篇针对强化学习可验证奖励后训练(RLVR)中监控器有效性与奖励作弊行为的实证分析研究。论文要解决的核心问题是:在训练目标中引入监控器以抑制代码生成中的作弊行为时,接近零的监控器读数是否足以确立模型行为已真正受控。

    深度解读完整解读
  4. 其他arXiv 2610.00812

    视频生成模型的后训练与对齐综述

    综述视频生成的后训练与对齐,并汇总基准与开放挑战

    发表
    摘要综述把视频后训练分成四类对齐信号,并指出奖励、长视频、权衡和安全仍开放。

    这是一篇视频生成 后训练与对齐 综述:预训练模型已有强先验,但作者认为仍不能可靠遵循意图、维持时间连贯或满足物理与安全约束。

    深度解读完整解读
  5. 防御arXiv 2609.38645

    用探针引导微调对齐模型且不损失可监控性

    用持续更新的探针做微调,降低有害性并保持线性可监测性

    发表
    被测模型
    Mistral 7B Instruct v0.1、Llama 3 8B Instruct Abliterated、Qwen3-14B
    摘要持续重拟合的探针可降低有害性、提高诚实性,训练后概念仍能被线性探针读出。

    Probe-guided fine-tuning 把探针分数当作唯一对齐信号,用来推动 harmlessness 与 honesty,并检查训练后这些概念是否仍线性可读。

    深度解读完整解读
  6. 防御arXiv 2609.36099

    通过逆向蒸馏实现数据遗忘(IDU)

    提出 IDU,在无保留样本时蒸馏单步生成器并抑制遗忘子集

    发表
    被测模型
    IDU one-step generator
    摘要IDU 同时做单步蒸馏和数据遗忘,在 MNIST 与 CIFAR-10 上压低遗忘类生成率。

    IDU 面向无条件 flow 与 score-based 教师,在蒸馏成单步生成器的同时做数据遗忘。

    深度解读完整解读
  7. 防御arXiv 2609.04665

    HackProbe:面向自演化语言模型奖励作弊的黑盒检测与免疫方法

    提出 HackProbe,黑盒检测并免疫自演化中的奖励作弊

    发表
    摘要黑盒探针检测自演化奖励黑客,并以带宽受限重选回收真实能力。

    HackProbe 是挂在自演化循环上的黑盒监控器,用来发现奖励黑客并改选候选。

    深度解读完整解读
已经到底了