跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

精选论文 20 篇
  1. 分析/可解释性arXiv:2610.09384 · 58

    人格层级模型解释微调 LLM 的上下文泛化,PPR 正则化将 RL 奖励作弊压至 0.2% 以下

    作者提出人格层级模型,发现微调前缀与默认人格距离越远泛化越狭窄;提出的PPR正则化将RL奖励作弊率降至0.2%以下。

    • 0.72Qwen3-4B跨4项行为角色距离与狭窄度的平均Pearson相关系数
    • 0.59Llama-3.1-8B跨4项行为角色距离与狭窄度的平均Pearson相关系数
    • 0.2%Qwen3-4B在LeetCode上经PPR强化学习后的各前缀最高作弊率
    6 问速览探讨大模型在特定前缀微调后行为跨上下文泛化的决定机制,提出人格层级模型与正则化约束方法。
    1. 这篇论文试图解决什么问题?

      探讨大模型在特定前缀微调后行为跨上下文泛化的决定机制,提出人格层级模型与正则化约束方法。

    2. 有哪些相关研究?

      梳理大模型角色表征、条件微调及微调后非预期泛化研究,指出本文聚焦于上下文转移的预测与调控。

    3. 论文如何解决这个问题?

      提出人格层级模型,形式化狭窄度指标,通过潜空间距离与激活修补验证机制,并设计 PPR 正则化。

    4. 论文做了哪些实验?

      在 120 个微调模型及 RL 任务上验证模型预测,PPR 将 RL 奖励作弊率降至至多 0.2% 且维持高准确率。

    5. 有什么可以进一步探索的点?

      作者指出上下文形式化仅限于固定提示词且相关性非严格线性,实验覆盖两款开源模型及四类行为。

    6. 总结一下论文的主要内容

      提出人格层级模型揭示微调跨上下文泛化规律,报告角色距离正相关性,通过 PPR 抑制 RL 作弊。

    完整解读
  2. 分析/可解释性arXiv:2610.05541 · 54

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    作者提出CAP与CSFD挖掘被抑制安全特征,消融特征在Gemma-3-4B-IT上使82.5%拒答翻转。

    • 82.5%Gemma-3-4B-IT 上消融单个特征的最大拒答翻转率(Table 1)
    • 100%Qwen3-1.7B 与 Llama-3.2-1B 的候选因果有效率(Table 1)
    • 0.29有害拒答提示词上特征抑制源放大 8 倍时的顺从翻转率(Table 2)
    6 问速览现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。
    1. 这篇论文试图解决什么问题?

      现有工具忽略静默特征,论文提出 CAP 与 CSFD 挖掘被抑制的安全特征以分析越狱机制。

    2. 有哪些相关研究?

      相关研究涵盖残差流拒答方向、稀疏自编码器回路与安全神经元,本文聚焦被抑制特征。

    3. 论文如何解决这个问题?

      论文提出 CAP 指标量化特征抑制潜能,并通过两阶段过滤算法 CSFD 快速筛选与验证。

    4. 论文做了哪些实验?

      实验显示 CSFD 候选特征具有高因果有效性,自然越狱与干预实验均观察到特征抑制现象。

    5. 有什么可以进一步探索的点?

      作者指出转码器重建误差、静态权重归因、裁判一致性分歧、模型规模及攻击单一性等局限。

    6. 总结一下论文的主要内容

      论文指出越狱通过抑制安全特征运作,提出 CAP 与 CSFD 补充了针对激活特征的解释性方法。

    完整解读
  3. 分析/可解释性arXiv:2609.06934 · 56

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    作者指认后验安全仅为抑制,而预训练持续共训练使 410M–6.9B 模型在攻击后保留 84%–91% AdvBench 拒答率。

    • 58.2%Qwen-2.5-7B-Instruct良性SFT后AdvBench拒答率
    • 10.9%Llama-3-8B-Instruct良性SFT后AdvBench拒答率
    • 84.0%Pythia-410M持续共训练良性SFT后AdvBench拒答率
    6 问速览后验安全微调容易被微调或推理攻击破坏,论文探究其权重几何根因并探索预训练阶段持久安全机制。
    1. 这篇论文试图解决什么问题?

      后验安全微调容易被微调或推理攻击破坏,论文探究其权重几何根因并探索预训练阶段持久安全机制。

    2. 有哪些相关研究?

      论文梳理了后验脆弱性、特征空间几何、临界期与预训练安全等研究,定位自身为连续几何解释与持久共训练。

    3. 论文如何解决这个问题?

      提出 Fisher 重叠比与曲率指标,建立核不动引理,并在发现表征底座突变规律后设计了跨预训练的持续共训练。

    4. 论文做了哪些实验?

      后验安全模型微调后 AdvBench 拒答率降 35–38 百分点,持续共训练在 410M–6.9B 模型上保留 84%–91%。

    5. 有什么可以进一步探索的点?

      作者指出了 Fisher 特征空间截断、攻击变体覆盖与分布外泛化等局限,后续计划测试曲率惩罚与扩充拒绝模板。

    6. 总结一下论文的主要内容

      论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    完整解读
已经到底了