跳到正文
10月9日 · 周五

全部论文

找到 2 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 648 篇还没打标签,不在筛选结果里。

另有 648 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2609.31122

    LocUS:面向定向激活引导的注意力头选择与子空间投影

    提出 LocUS,用词汇子空间选择注意力头并约束激活转向

    发表
    测试
    Mistral-7B-v0.1、Mistral-7B-Instruct-v0.3、Llama-3.1-8B 等 7 个
    摘要LocUS 用词汇子空间约束 DoM 转向的位置和方向。

    LocUS 是不更新权重的推理时转向方法,把差分均值更新限制在少数注意力头及其属性对齐子空间。

    深度解读完整解读
  2. 防御arXiv 2609.19144

    面向 LLM 偏好对齐的零阶范式:ComPO 方法

    提出零阶偏好对齐方法 ComPO,从低边际偏好对估计更新方向

    发表
    测试
    Mistral-7B-Base、Mistral-7B-Instruct、Llama-3-8B-Base 等 8 个
    摘要ComPO 用比较预言机处理低边际对,并在多个模型上提高 LC 胜率。

    ComPO 是一种基于比较预言机的零阶偏好对齐方法,用来从低边际偏好对取出方向信息,而不在这些对上直接优化可微偏好损失。

    深度解读完整解读
已经到底了