跳到正文
10月9日 · 周五

全部论文

找到 13 篇

另有 656 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv 2610.08540

    论文提出按风险类别测量的对齐缩放定律框架

    提出分风险对齐标度律框架,测量各类风险的对齐负担如何随规模变化

    发表
    测试
    Pythia (14m–2.8b)、Qwen2.5 (0.5B–72B)、Qwen2.5-Instruct (0.5B–14B) 等 4 个
    摘要论文提出了分风险对齐标度律框架,测得真实性与倾向纠错呈标度有益,但盲后门仍存活,揭示隐藏风险的长期挑战。

    本文提出了一个将大语言模型对齐难度形式化为可测量标度关系的理论框架与预注册评测协议。

    深度解读完整解读
  2. 攻击arXiv 2610.06848

    TranScope:利用 CPU 性能计数器对 Transformer 做成员推断攻击

    提出 TRANSCOPE,用 CPU 硬件计数器推断训练集成员

    发表
    攻击者
    黑盒
    测试
    Pythia (70M-2.8B)、BERT (4.4M-340M)、ViT (22M-307M) 等 5 个

    摘要TRANSCOPE 揭示了分词器在嵌入表引发的硬件访问局部性差异,证实微架构计数器可突破恒定时间与置信度遮蔽防御。

    深度解读完整解读
  3. 其他arXiv 2402.00838

    OLMo:加速语言模型科学研究

    发布开放语言模型 OLMo、Dolma 数据与训练评测代码

    发表
    测试
    Pythia 1B、Pythia 6.9B、OLMo-1B 等 15 个
    摘要OLMo 开放 1B/7B 模型、Dolma 与训练评测工件。

    Allen Institute 发布 OLMo:一套从数据、训练到评测都公开的语言模型框架,用来支持对语言模型能力、弱点、偏见与风险的研究。

    深度解读完整解读
  4. 可解释性arXiv 2609.29362

    SAE 潜空间中词性作为涌现类别:LLM 形态句法信息呈分布式编码

    检验词性在 SAE 潜空间是单特征还是紧凑组编码

    发表
    测试
    EleutherAI/sae-llama-3-8b-32x、LLaMA-3-8B
    摘要词性可从 SAE 恢复,由大小随类别变化的 latent 组承载,留出后仍激活但不专属。

    Bondielli、Passaro、Auriemma 和 Lenci 用词性检验 SAE latent 如何组织形态句法信息。。

    深度解读完整解读
  5. 可解释性arXiv 2609.30954

    FTB Graph:多语言模型首 token 广播器与语言身份头电路的结构分析

    用激活修补定位并验证多语模型首 token 语言身份电路

    发表
    测试
    Pythia-1B、Pythia-2.8B、GPT-2 等 6 个
    摘要首 token 语言路由在预训练中形成。

    六个不超过 2.8B 的多语模型上,第一个生成 token 的语言身份被抽成经过精确修补验证的注意力电路。。

    深度解读完整解读
  6. 可解释性arXiv 2609.32355

    语言模型定向特征学习:检测用激活值,干预用梯度

    比较激活值与梯度定向特征的检测和干预效果

    发表
    测试
    Pythia-70M、GPT-2、Llama-3.1-8B
    摘要定向特征的检测与干预依赖信号和估计器,二者并不对齐。

    作者比较假设驱动的定向特征学习:为预先指定概念构造单一特征,并同时看检测与因果干预。CAA 与 GRADIEND 原先同时改变信号和估计器。本文将 activation value、activation gradient、parameter gradient 与 contrastive mean、IEND 交叉,补齐 ACTIEND、AGIEND、CAGA、CGA,并以预训练 SAE 为非定向参照。

    深度解读完整解读
  7. 可解释性arXiv 2609.35351

    概念提取中的干扰不止取决于几何结构:稀疏自编码器研究提出有效干扰

    提出 effective interference,分析 SAE 架构如何塑造已实现特征干扰

    发表
    测试
    Pythia-160M-deduped、gemma-2-2b
    摘要干扰取决于几何、使用方式与产生 code 的架构。

    Costa 与 Tolooshams 把概念提取中的干扰从纯几何改写成几何与 code 统计的联合量,并说明 SAE 架构决定这些交互被抵消还是被保留。。

    深度解读完整解读
  8. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    测试
    Pythia-1.4B、Pythia-410M、Pythia-1B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  9. 攻击arXiv 2609.10611

    WPMIA:面向严格黑盒大模型的词级概率成员推断攻击

    提出严格黑盒成员推断 WPMIA,用采样估计词级概率判断训练成员

    发表
    攻击者
    黑盒
    测试
    Pythia-6.9B、GPT-NeoX-20B、Pythia-dedup 160M 等 12 个
    摘要WPMIA 从续写估计词级似然并对比前缀,黑盒上多数优于所列基线。

    WPMIA 是面向严格黑盒的 LLM 预训练数据成员推断:攻击者只能看到文本续写。

    深度解读完整解读
  10. 分析与理论arXiv 2609.33909

    近重复家族干扰精确记录成员推断

    分析近重复族如何让精确记录成员推断误判为入训

    发表
    测试
    Pythia-2.8B、GPT-2、Qwen3.5-2B 等 5 个
    摘要近重复使干净参照 MI 把族级暴露当成精确记录。

    作者研究成员推断能否作为精确记录的数据来源证据。版权和来源审计需要的是该记录本身是否入训,而网页语料中的转载、镜像和轻改会让非同一近重复产生成员样分数。四世界审计用 E 表示精确记录是否入训、用 F 表示其近重复族是否在场,从而分开 H00 到 H10 的标准 MI、H00 到 H01 的族偏移,以及 H01 到 H11 的 exact-given-family。

    深度解读完整解读
已经到底了