跳到正文
10月10日 · 周六

全部论文

找到 7 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 194 篇还没打标签,不在筛选结果里。

另有 194 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 防御arXiv 2610.04299

    R-Quest:用问题有效性与新颖性反馈维持推理模型自我进化

    提出 R-Quest,用有效性与新颖性反馈维持推理模型自我进化

    发表
    被测模型
    Qwen3-4B-Base、OctoThinker-3B-Hybrid-Base
    摘要R-Quest 用有效性与新颖性反馈维持自进化。

    R-Quest 处理的是推理模型自进化中的题目质量:questioner 与 solver 用 GRPO 交替从自生成题目学习时,多轮之后平均成绩会下降。

    深度解读完整解读
  2. 防御arXiv 2610.02126

    Local Support Learning:无需旧数据缓解 LLM 灾难性遗忘

    提出 Local Support Learning,把微调适配器限制在当前数据支撑以缓解遗忘

    发表
    被测模型
    Qwen2.5-7B-Instruct、Qwen2.5-3B-Instruct、Qwen2.5-1.5B-Instruct
    摘要LSL 用 GMM 门把适配器限制在当前数据支撑内,以减轻多阶段遗忘。

    LSL 是不访问旧数据、在后训练中保持先前能力的框架。

    深度解读完整解读
  3. 防御arXiv 2610.01170

    HeadEdit:通过冻结的 unembedding 矩阵校准语言模型行为

    提出 HeadEdit,经冻结 unembedding 做随输入变化的 logit 校正

    发表
    被测模型
    Qwen3-4B、Gemma-3-4B-IT、Llama-3.2-3B-Instruct 等 4 个
    摘要低秩 unembedding 校正抬高九个设置的总体准确率,并可部分预测 DPO 更新。

    HeadEdit 是一种不更新参数的行为校准方法,作用点是冻结的 unembedding,而不是中间层残差或新的梯度优化。

    深度解读完整解读
  4. 防御arXiv 2609.34857

    CREDO:用可微读出替代文本采样校准推理模型置信度

    提出 CREDO,用保留 token 对的可微读出校准推理模型置信度

    发表
    被测模型
    Qwen3-8B、Qwen3-1.7B、Qwen3-4B
    摘要CREDO 用可微两 token 读出替代口头置信,在数学和代码上同时拉高准确率与校准。

    CREDO 把 RLVR 里的置信从“采样一个数字”改成“读一对保留 token 的相对概率”,并用可微回归和差异加权同时拉准确率与校准。。

    深度解读完整解读
  5. 防御arXiv 2609.27124

    Fed-ADR:用恶意编排服务器协同客户端梯度操纵攻击联邦学习

    提出 Fed-ADR,用编排服务器协同操纵梯度攻破联邦学习并检测恢复

    发表
    攻击者
    灰盒
    被测模型
    CNN(MNIST:2 Conv + 3 FC)、CNN(Fashion-MNIST:6 Conv + 1 FC)、ResNet18(CIFAR-10)
    摘要Fed-ADR 用 gray-box 编排攻击绕过多种聚合防御,再用 Hessian 一致性检测和窗口内恢复把准确率拉回。

    Fed-ADR 是一套面向联邦学习的攻击、检测与恢复框架:编排服务器改写合谋客户端的梯度,使参数服务器的现有防御把投毒更新当成良性,同时在发现后用历史梯度把全局模型原地修回来。

    深度解读完整解读
  6. 防御arXiv 2609.21561

    自蒸馏中的排斥与吸引教师:将正确性与行为分离

    提出对比自蒸馏,分离正确性与行为偏移

    发表
    被测模型
    Qwen3-4B、Qwen3-4B-Instruct-2507
    摘要隔离自蒸馏后,对比正确与错误解教师可抵消行为偏移并稳定提升推理。

    把自蒸馏从 GRPO 里拆开后,用靠近正确解教师、远离错误解教师的对比信号,把正确性和行为分开。。

    深度解读完整解读
已经到底了