跳到正文
10月8日 · 周四

全部论文

精选论文 220 篇
  1. 分析/可解释性arXiv:2610.02015 · 55

    研究:RLVR 后训练在全新推理任务上引发语言漂移

    作者称理论证明RLVR允许无界语言漂移且限制漂移必限制奖励,实验显示新任务RLVR会导致降低互读性的独特语言漂移。

    • -0.24Llama在GSM8K上Best-Perf检查点的痕迹可读性AUC差值(Table 2)
    • -0.17Gemma在GSM8K上Best-Perf检查点的痕迹可读性AUC差值(Table 2)
    • 0.02Qwen在GSM8K上Best-Perf检查点的痕迹可读性AUC差值(Table 2)
    6 问速览探明RLVR后训练中语言漂移的成因,以及限制漂移对模型性能的理论制约。
    1. 这篇论文试图解决什么问题?

      探明RLVR后训练中语言漂移的成因,以及限制漂移对模型性能的理论制约。

    2. 有哪些相关研究?

      梳理RL中的语言漂移、前沿模型不可读推理痕迹,以及通过偏好或提示诱导新型语言行为的研究。

    3. 论文如何解决这个问题?

      建立语言漂移与训练过程的形式化理论,证明RLVR的无界漂移与奖励权衡,并设计片段可读性评测协议。

    4. 论文做了哪些实验?

      在GSM8K上用三款小模型对比RLVR与SFT,验证新任务下RLVR导致更大漂移且每次漂移方向独特。

    5. 有什么可以进一步探索的点?

      作者指出了模型较小、数据集单一及缺少定理3实证等局限,实证范围覆盖到1.5B模型和GSM8K。

    6. 总结一下论文的主要内容

      论文证明并验证了RLVR在新任务上必然诱发独特的语言漂移,揭示了前沿推理模型可监控性的安全隐患。

    完整解读
  2. 分析/可解释性arXiv:2609.37616 · 55

    语言模型中的权威偏差:来源顺从与用户认同并非同一行为

    作者发现验证源背书使7款模型在TriviaQA翻转45%–88%基准正确项,并通过干预区分了源依从与用户迎合。

    • 87.5%Grok-4.20 TriviaQA验证源翻转率(Table 15)
    • 44.9%Qwen3.5-27B TriviaQA验证源翻转率(Table 15)
    • -77.5 ppGPT-OSS L16移除源方向后源错误率变化(Table 4)
    6 问速览论文研究语言模型对验证源的权威依从与对用户的迎合是否由相同内部通路驱动,并检验其因果可分性。
    1. 这篇论文试图解决什么问题?

      论文研究语言模型对验证源的权威依从与对用户的迎合是否由相同内部通路驱动,并检验其因果可分性。

    2. 有哪些相关研究?

      论文梳理了阿谀现象、权威归因、检索风险与表征工程等研究,强调本文在固定答案下因果分离了来源与用户背书。

    3. 论文如何解决这个问题?

      论文通过对比激活提取权威、源与用户方向,结合正交投影移除与双向跨度归因补丁因果解耦来源依从与用户迎合。

    4. 论文做了哪些实验?

      实验覆盖8款模型,发现验证源诱导45%–88%翻转,干预区分了源与用户表征,权威移除降低了顺从且保持通用能力。

    5. 有什么可以进一步探索的点?

      作者指出网格最优选择未校正区间、机理分析限于开源模型、缺乏智能体动态环境与正向利用检验等局限。

    6. 总结一下论文的主要内容

      论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。

    完整解读
  3. 分析/可解释性arXiv:2609.05241 · 55

    10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    10a Labs分析开源生态,发现原版去安全模型平均被重新打包2.4次,重分发层构成持久留存基础。

    • 2.4HuggingFace原版去安全模型平均被重新打包次数
    • 52%前3名重分发者占全部压缩重分发仓库比例
    • 25%GitHub去安全模型应用中明确恶意类别的占比
    6 问速览论文测绘了去安全开源大模型从生产、压缩重分发到下游部署的完整供应链,阐明其规模与持久留存机制。
    1. 这篇论文试图解决什么问题?

      论文测绘了去安全开源大模型从生产、压缩重分发到下游部署的完整供应链,阐明其规模与持久留存机制。

    2. 有哪些相关研究?

      相关研究聚焦于去安全模型实证统计、网络犯罪知识图谱分析、地下黑市流通以及底层去安全技术。

    3. 论文如何解决这个问题?

      论文结合多语言检索与GPT-5分类,构建了覆盖模型生产、重分发与应用部署的供应链测绘体系。

    4. 论文做了哪些实验?

      论文报告原版模型平均被重包装2.4次,前三名重分发者占52%份额,下游应用主要依赖Ollama分发。

    5. 有什么可以进一步探索的点?

      作者在第4.2节指出了平台范围、分类验证、技术归因、统计周期、检索上限与基模溯源共六项局限。

    6. 总结一下论文的主要内容

      论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    完整解读
  4. 分析/可解释性arXiv:2609.25366 · 55

    研究:思维链对答案的约束随模型相对任务难度而变化

    作者通过扰动续写发现CoT承重性随难度上升:Gemma在GSM8K错误传播率3.9%,在BBH达40.9%。

    • 94.5%Gemma-2-9B-IT,GSM8K,旁路率(Table 1)
    • 40.9%Gemma-2-9B-IT,BBH,错误传播率(Table 1)
    • 98.8%Gemma-2-9B-IT,序贯模型已解释离差中难度项占比(Table 5)
    6 问速览探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。
    1. 这篇论文试图解决什么问题?

      探究思维链是否真正因果约束最终答案,发现思维链承重性随任务难度提升而由装饰性向承重性转变。

    2. 有哪些相关研究?

      围绕思维链忠实性行为分析、机制可解释性与模型自我修正展开,本文在可扩展的因果扰动与表征分析上确立定位。

    3. 论文如何解决这个问题?

      提出基于续写的因果测试协议,通过单步扰动与截断续写度量思维链承重性,并结合探针与激活引导检验其表征与可控性。

    4. 论文做了哪些实验?

      作者在被测模型和正确多步基线中比较难度、扰动、表征与干预;结果支持承重性与模型相对难度相关,但不构成跨模型的普遍因果规律。

    5. 有什么可以进一步探索的点?

      汇总作者明确提出的模型规模、单步扰动与标签噪声等局限,并客观梳理实验覆盖的边界。

    6. 总结一下论文的主要内容

      在所测续写干预与模型中,思维链对答案的约束随任务和后训练条件而变;这种单向承重性不能等同完整机制忠实性。

    完整解读
  5. 分析/可解释性arXiv:2609.06934 · 56

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    作者指认后验安全仅为抑制,而预训练持续共训练使 410M–6.9B 模型在攻击后保留 84%–91% AdvBench 拒答率。

    • 58.2%Qwen-2.5-7B-Instruct良性SFT后AdvBench拒答率
    • 10.9%Llama-3-8B-Instruct良性SFT后AdvBench拒答率
    • 84.0%Pythia-410M持续共训练良性SFT后AdvBench拒答率
    6 问速览后验安全微调容易被微调或推理攻击破坏,论文探究其权重几何根因并探索预训练阶段持久安全机制。
    1. 这篇论文试图解决什么问题?

      后验安全微调容易被微调或推理攻击破坏,论文探究其权重几何根因并探索预训练阶段持久安全机制。

    2. 有哪些相关研究?

      论文梳理了后验脆弱性、特征空间几何、临界期与预训练安全等研究,定位自身为连续几何解释与持久共训练。

    3. 论文如何解决这个问题?

      提出 Fisher 重叠比与曲率指标,建立核不动引理,并在发现表征底座突变规律后设计了跨预训练的持续共训练。

    4. 论文做了哪些实验?

      后验安全模型微调后 AdvBench 拒答率降 35–38 百分点,持续共训练在 410M–6.9B 模型上保留 84%–91%。

    5. 有什么可以进一步探索的点?

      作者指出了 Fisher 特征空间截断、攻击变体覆盖与分布外泛化等局限,后续计划测试曲率惩罚与扩充拒绝模板。

    6. 总结一下论文的主要内容

      论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    完整解读
  6. 分析/可解释性arXiv:2609.38205 · 56

    系统提示词幻觉:指令前导如何改变语言模型内部计算

    作者分析17个模型的表征,发现角色指令深度重构中间表征,而安全指令仅浅层变化且与无限制指令路径近乎一致。

    • 0.99714个核心模型安全与无限制指令CKA相关均值
    • 50.3% ± 19.5%14个核心模型角色类提示词平均渗透深度
    • 7.3% ± 9.2%14个核心模型安全类提示词平均渗透深度
    6 问速览分析系统提示词如何改变模型内部逐层表征,探究其究竟是深层重构还是表层微调,并阐释安全提示词的越狱脆弱机理。
    1. 这篇论文试图解决什么问题?

      分析系统提示词如何改变模型内部逐层表征,探究其究竟是深层重构还是表层微调,并阐释安全提示词的越狱脆弱机理。

    2. 有哪些相关研究?

      梳理表征相似度、机械可解释性、系统提示词与对齐、层级分析与缩放四类研究,指出此前缺乏对单模型内部表征的系统测量。

    3. 论文如何解决这个问题?

      构建结合CKA表征渗透深度、因果激活修补、二阶微扰界与逐层线性探测的分析框架,量化并验证提示词的内部影响。

    4. 论文做了哪些实验?

      横跨17个模型评估表征渗透率,显示角色指令深度重构而安全指令仅浅层微调,且安全与解除限制指令路径近乎重合。

    5. 有什么可以进一步探索的点?

      作者指出了模型未达前沿尺度、CKA缺乏特征级分辨率、未测多轮解码动态及提示词全为英文等局限。

    6. 总结一下论文的主要内容

      系统提示词引发层选择性表征改变,安全指令的浅层化特征从机理上解释了其对对抗越狱的脆弱性。

    完整解读
  7. 分析/可解释性arXiv:2609.32717 · 57

    研究揭示语义保持变换下的 LLM 对齐与效用不对称

    研究者测试语义保留变换,发现模型效用保留时对齐失效大幅上升,如微调 GPT-4.1 mini 的 ASR 达 74.3%。

    • 74.3%GPT-4.1 mini 在 AdvBench 上的变换后 ASR(微调)
    • 43.0%Gemini 3 Flash 在 AdvBench 上的变换后 ASR(ICL)
    • 40.3%Llama3-8B 在 AdvBench 上的变换后 ASR(ρ=0 微调)
    6 问速览研究大语言模型在语义保留变换引起的输入分布偏移下,其安全对齐是否能够像任务效用一样稳健泛化。
    1. 这篇论文试图解决什么问题?

      研究大语言模型在语义保留变换引起的输入分布偏移下,其安全对齐是否能够像任务效用一样稳健泛化。

    2. 有哪些相关研究?

      涵盖浅层对齐表征机制、基于编码与提示词的越狱攻击以及少量样本微调越狱等相关研究。

    3. 论文如何解决这个问题?

      构建规则可逆的合成变换作为受控探针,通过微调与上下文学习促使模型适应,并配对评估效用与对齐。

    4. 论文做了哪些实验?

      在八款模型上测试效用与安全,发现普遍存在对齐失效上升幅度远大于效用降幅的非对称现象。

    5. 有什么可以进一步探索的点?

      作者指出的局限包括变换限于字符级编码、内部表征机制尚未完全厘清以及未提出专用防御方案等。

    6. 总结一下论文的主要内容

      论文报告了语义保留变换下的对齐-效用不对称性,指出安全对齐泛化比效用更为脆弱,呼吁改进评估流程。

    完整解读
已经到底了