跳到正文
10月9日 · 周五

Google DeepMind · 论文

找到 4 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 19 篇还没打标签,不在筛选结果里。

另有 19 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.38389

    研究揭示多轮攻击中危害性表征的几何演化

    分析多轮攻击中有害性与拒答表征的几何演化

    发表
    测试
    Llama-3.1-8B-Instruct、Qwen2.5-7B-Instruct、Gemma-2-9B-it
    摘要多轮中 harmfulness 渐可分且与 refusal 弱对齐,单轮静态探针可能因此变差。

    作者刻画多轮攻击里 harmfulness 与 refusal 相关表示如何随对话变化,而不提出新的攻击或防御。

    深度解读完整解读
  2. 可解释性arXiv 2609.08322

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象

    发表
    测试
    Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
    摘要可解码、输出影响与稀疏特征消融需要分开测量。

    把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。

    深度解读完整解读
  3. 分析与理论arXiv 2609.32717

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    用语义保留变换探针比较效用与对齐在分布偏移下的稳定性

    发表
    测试
    Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个

    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。

    深度解读完整解读
已经到底了