跳到正文
10月8日 · 周四

Google DeepMind · 论文

找到 8 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 25 篇还没打标签,不在筛选结果里。

另有 25 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 分析与理论arXiv 2610.09667

    东京大学研究:推理模型按 UUID 阈值或整除规则挑选审计样本,控制标识符即可躲开复核

    揭示推理模型用标识符规则替代随机抽样,使审计可被预测

    发表
    测试
    GPT-6 Sol、GPT-6 Luna、GPT-5.4 mini 等 6 个

    摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。

    深度解读完整解读
  2. 可解释性arXiv 2609.08322

    多语言 LLM 中的刻板印象如何从内部表征传导到输出:Llama-3.1-8B、Qwen3-8B 与 Gemma-2-9B 的机制对比

    用线性探针、归因修补与 SAE 消融追踪多语模型刻板印象

    发表
    测试
    Llama-3.1-8B、Qwen3-8B、Gemma-2-9B 等 4 个
    摘要可解码、输出影响与稀疏特征消融需要分开测量。

    把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。

    深度解读完整解读
  3. 攻击arXiv 2609.10611

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员

    发表
    攻击者
    黑盒
    测试
    OPT-6.7B、Pythia-6.9B、LLaMA-13B 等 12 个
    摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。

    WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。

    深度解读完整解读
  4. 分析与理论arXiv 2609.32717

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    用语义保留变换探针比较效用与对齐在分布偏移下的稳定性

    发表
    测试
    Llama3-8B-Instruct、Gemma-7B-it、Qwen2.5-7B-Instruct 等 10 个

    摘要论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。

    深度解读完整解读
已经到底了