跳到正文
10月8日 · 周四

全部论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 701 篇还没打标签,不在筛选结果里。

另有 701 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2610.09600

    SafeEvo:从拒答回路视角解释大模型安全对齐机制与演化

    用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路

    发表
    测试
    Llama-3-8B、Qwen-2.5-7B、Mistral-7B-v0.1 等 4 个

    摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。

    深度解读完整解读
  2. 分析与理论arXiv 2609.35677

    RLVR 中的验证器错误:奖励作弊、反馈局限与选择性控制

    刻画不完美验证器下 RLVR 奖励黑客的增长并用投影审计校正实现选择性控制

    发表
    测试
    log linear policy、neural policy、Qwen2-0.5B
    摘要固定验证器的 RLVR 会把验收与黑客绑在一起。

    作者分析固定、不完美验证器下的 RLVR:验证器无假阴性,因而同时奖励正确回答和被接受错误,平均奖励只看总验收概率。

    深度解读完整解读
已经到底了