跳到正文
10月9日 · 周五

全部论文

找到 4 篇
筛选4
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 676 篇还没打标签,不在筛选结果里。

另有 676 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产与重分发留存链路

    发表
    测试
    Qwen、Llama、Gemma 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
  2. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    测试
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  3. 可解释性arXiv 2609.23587

    大型推理模型的效率与安全困境:量化与剪枝如何影响越狱鲁棒性

    分析量化、剪枝与 KV 缓存压缩对推理模型越狱鲁棒性的影响

    发表
    测试
    QwQ-32B、DeepSeek-R1-Distill-Qwen-32B、DeepSeek-R1-Distill-Llama-8B 等 4 个
    摘要效率压缩常使 LRM 越狱 HR 下降,作者将其归因于推理退化而非对齐增强。

    作者分析量化、剪枝和 KV 缓存压缩如何同时改变 LRM 的显存、推理和越狱脆弱性。。

    深度解读完整解读
  4. 分析与理论arXiv 2609.16927

    SALVE:用文本优化还原蒸馏数据中的隐性学习效应

    提出 SALVE,用文本优化检测蒸馏数据中的潜意识学习效应

    发表
    测试
    Qwen2.5-7B-Instruct、OLMo-3-7B-Instruct、Llama-3.1-8B-Instruct 等 8 个
    摘要SALVE 用软提示加 beam search 口头化,把潜意识数据里的教师特质恢复成可读提示。

    SALVE 是一种文本优化方法,用来在训练学生之前,把潜意识学习数据里读不出来的教师特质说成可读系统提示。

    深度解读完整解读
已经到底了