跳到正文
10月9日 · 周五

全部论文

找到 5 篇

另有 669 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 10a Labs 测绘无审查开源模型生态:3,471 个原始模型与 8,164 次再分发

    测绘去安全开源模型的生产与重分发留存链路

    发表
    测试
    Qwen、Llama、Gemma 等 10 个

    摘要论文测绘了去安全开源大模型供应链,作者指出高集中度的重分发层赋能模型持久留存与部署扩散。

    深度解读完整解读
  2. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    解释后验安全的权重几何脆弱性,并提出预训练持续安全共训练

    发表
    测试
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  3. 可解释性arXiv 2609.37737

    研究用因果激活修补定位模型服从提示注入指令的决策层

    用因果激活修补定位模型服从提示注入的决策层

    发表
    测试
    Qwen3-4B、Qwen3-14B、Qwen3-32B 等 7 个
    摘要合规的因果杠杆集中在网络后三分之一的低秩子空间,该层也是混淆下检测最好的位置。

    这篇工作用逐层激活修补定位提示注入合规发生在网络何处,并把该位置用于检测验证。。

    深度解读完整解读
已经到底了