跳到正文
10月9日 · 周五

全部论文

找到 2 篇
筛选2
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 432 篇还没打标签,不在筛选结果里。

另有 432 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.00568

    研究提出对齐诱导不忠实:对齐训练让模型静默改写输入内容

    提出 FAITHCONFLICT,测量对齐训练导致模型静默改写相悖输入

    发表
    测试
    Aya Expanse 8B、Aya Expanse 32B、Llama-3.1-8B-Instruct 等 13 个
    摘要论文揭示并系统分析了大语言模型在安全与常识冲突下静默背离输入的 AIU 现象与三元冲突困境。

    本文系统揭示并实证分析了语言模型后训练中存在的“能力–安全–忠实度”三元冲突。

    深度解读完整解读
  2. 可解释性arXiv 2609.16967

    多语言模型的目标语言生成:激活引导与最优控制

    将目标语言生成写成激活最优控制并比较转向方法

    发表
    测试
    Tiny Aya 3B、Llama 3.2 1B、BLOOM 7.1B 等 9 个
    摘要LiSeCo 把语言转向做成最小扰动闭式控制。

    作者要解决多语言模型生成时漂离目标语言的问题,并认为只看语言识别不够。他们定义语言贴合、n-gram 语言形式连贯和相对两个结尾的语义连贯,三者同时成立才计 adhered coherence。方法上,层间激活被写成离散动力系统。

    深度解读完整解读
已经到底了