跳到正文
10月10日 · 周六

全部论文

找到 3 篇
筛选1
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.03240

    通过模型路由与协作实现集体偏见缓解

    提出 CBM,用模型路由与多模型协作缓解群体偏见

    发表
    被测模型
    Qwen/Qwen2.5-32B-Instruct、Qwen/Qwen2.5-14B-Instruct、google/gemma-2-9b-it 等 7 个
    摘要CBM 用路由挑选模型并按拓扑协作,在若干设定下降低 BBQ 偏见分。

    CBM 是一个推理时的多模型去偏框架:用路由为查询选模型,再按拓扑协作,以降低社会偏见分。

    深度解读完整解读
  2. 防御arXiv 2609.39107

    MASCRDM:面向大语言模型训练过程的合规风险检测与缓解多智能体系统

    提出 MASCRDM,在监督微调中实时检测并缓解偏见

    发表
    被测模型
    Qwen3-8B-Base、Llama-3.1-8B
    摘要MASCRDM 在 SFT 中按法规图谱检测数据、结构与损失风险,BBQ 总准确率在两模型上最高。

    MASCRDM 把 AI 法律规章编成知识图谱,再由五个智能体在 LLM 训练中做实时合规检测与缓解,实验以偏见与歧视为代表风险。

    深度解读完整解读
  3. 防御arXiv 2609.33086

    研究者提出基于评分量表的可解释奖励框架,将宪法转化为可调对齐目标

    提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调

    发表
    被测模型
    Gemma 3 12B、Qwen3 14B、GPT-OSS 20B
    摘要宪法级可解释奖励让优先级可检查、可改写,并带入训练后的行为。

    作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。

    深度解读完整解读
已经到底了