跳到正文
10月8日 · 周四

全部论文

找到 16 篇

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.05637

    研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点

    提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口

    发表
    测试
    Claude Sonnet 4.6、Gemini 3.5 Flash、Molmo2-8B 等 5 个

    摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。

    深度解读完整解读
  2. 防御arXiv 2609.05797

    论文发现安全监控器主要拦截模型本就会拒答的请求

    构建明确度梯级并做守卫微调,以拦住模型会回答的有害请求

    发表
    测试
    Gemma-4-31B-IT、Qwen3-32B、Llama Guard 3 8B 等 6 个

    摘要论文发现安全监视器大多拦截模型已拒答请求,指出明确度偏差是共性原因,并通过双侧梯级微调提升回答请求的召回表现。

    深度解读完整解读
  3. 防御arXiv 2609.37837

    Intent-Privilege OPSD:让视觉语言模型在隐式风险下兼顾安全与有用

    提出 Intent-Privilege OPSD,蒸馏证据化意图以对齐视觉语言模型的安全与有用

    发表
    测试
    Qwen3-VL-4B-Instruct、LLaVA-1.5-7B、InternVL2-8B
    摘要证据化意图只在训练时使用,单次蒸馏同时提高联合成功并降低数据与训练时间。

    Intent-Privilege OPSD 针对视觉语言模型的跨模态隐式风险,把安全与有用性放进同一个训练目标,并要求部署时不再看意图。图像和文本可以各自无害、合在一起才有风险。

    深度解读完整解读
  4. 防御arXiv 2610.01800

    LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法

    提出 LineupRL,用描述到序列识别作可验证奖励训练时序描述模型

    发表
    测试
    Qwen2.5-VL-3B、Qwen2.5-VL-72B、Qwen3-VL-8B 等 15 个
    摘要LineupRL 用统计近邻上的序列识别做可验证奖励,3B 描述器超过 SFT、两种 RL 奖励和 72B 教师。

    LineupRL 是给开放式时间序列描述用的 RLVR:不模仿合成参考,而奖励一条描述能否让冻结文本 LLM 从相近序列里认出目标。

    深度解读完整解读
  5. 防御arXiv 2609.38847

    ProRubric:通过协议级评分标准缓解 Rubric-RL 中的奖励作弊

    提出 ProRubric,把加性评分聚合改为合取协议以抑制奖励作弊

    发表
    测试
    Qwen3-4B、Qwen3-8B
    摘要ProRubric 用离线合取维度替换加性求和,在继续学习时抬高适当性且不损失覆盖率。

    Protocol-level Rubrics(ProRubric) 研究的是:没有可验证器时,把 rubric 判分合成奖励的方式会不会让优化变成分数更高、回答更差。

    深度解读完整解读
  6. 防御arXiv 2609.12459

    EvoRS:面向开放式强化学习的奖励系统在线自演化框架

    提出 EvoRS,使开放式强化学习的奖励系统随策略在线演化

    发表
    测试
    Qwen3-4B、Qwen3-8B、Qwen3.5-27B 等 7 个
    摘要EvoRS 用 on-policy 证据演化完整奖励系统,在写作和角色扮演上同时提高质量并降低黑客与覆盖失败。

    EvoRS 研究开放式 RL 中奖励系统如何在训练期间保持可靠。写作和角色扮演没有可直接验证的答案,策略一旦适应当前 rubric,奖励会出现黑客、漏掉新行为,以及同查询内更难区分。作者认为只动态改评价标准不够,打分机制和信号组合也会失效。

    深度解读完整解读
  7. 防御arXiv 2609.12623

    SteerDuplex:可操控的全双工语音对话模型

    提出 SteerDuplex,用监督微调与两阶段强化学习提升全双工语音对话可控性

    发表
    测试
    SteerDuplex-SFT、SteerDuplex-RL、Moshi 等 4 个
    摘要SteerDuplex 用 SFT 提升语音可控,用两阶段 RL 改时序,并记录奖励黑客。

    SteerDuplex 是基于 Moshi 的全双工语音模型,目标是在保留轮替、打断和一般任务能力的同时,按用户指令改变内容与发声。

    深度解读完整解读
  8. 防御arXiv 2609.33221

    RMB:用奖励模型 boosting 缓解 RLHF 中的奖励作弊

    提出 RMB,以多样奖励模型 boosting 缓解 RLHF 奖励作弊

    发表
    测试
    Gemma-2B-IT、Mistral-7B-Instruct-v0.2、DeepSeek-R1 等 7 个
    摘要RMB 用 HSIC 多样奖励模型加决策树 boosting,提高偏好准确率并缓解 reward hacking。

    RMB 是一种奖励建模方法:用多样的代理奖励模型加 boosting 聚合,为 RLHF 提供更稳的奖励信号。。

    深度解读完整解读
  9. 防御arXiv 2608.18607

    VA-Judger:面向联合视频-音频生成的人类偏好反馈奖励建模

    提出 VA-Judger,用人类偏好训练联合音视频奖励模型

    发表
    测试
    Qwen3-Omni、VA-Judger、LTX-2 等 6 个
    摘要VA-Judger 用易到难的人类偏好学习做联合音视频奖励,并用于 LTX-2 后训练。

    VA-Judger 是面向联合音视频生成的思维链全模态奖励模型,用来替代由分维度专家指标拼成的强化学习奖励。

    深度解读完整解读
  10. 防御arXiv 2609.06346

    面向后门攻击下持续学习的鲁棒动态扩展:净化与选择性恢复

    提出 BPP、GDBRO 与 RFCBES,在持续学习中净化并选择性恢复后门样本

    发表
    测试
    ViT-B/16、ResNet-18、ResNet-50
    摘要用净化、梯度筛选恢复和鲁棒原型路由,把动态扩展持续学习接到任务级后门防御上。

    面向 CLUBA 的鲁棒动态扩展防御:每个增量任务都可能含少量后门样本,模型只能看到当前任务数据,却要同时少遗忘、学得会、还不记住触发。

    深度解读完整解读
  11. 防御arXiv 2609.36900

    STAR-GRPO:用可靠性优先优势估计抑制奖励作弊

    提出 STAR-GRPO,用成对可靠性约束抑制奖励作弊

    发表
    测试
    Llama-3.2-1B-Instruct、Skywork-Reward-V2-Qwen3-8B、Qwen3-4B 等 6 个
    摘要STAR-GRPO 用成对可靠性约束 GRPO 优势,在两种奖励黑客设定中限制无支撑分数。

    STAR-GRPO 是一种可靠性优先的组相对优势估计:同一 rollout 的两个评分决定更新强度,任务奖励仍由预指定质量路径选择。

    深度解读完整解读
已经到底了