跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 2 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 18 篇还没打标签,不在筛选结果里。

另有 18 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 可解释性arXiv 2609.06934

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    用权重几何解释事后安全脆弱,并提出预训练持续安全共训练

    发表
    测试
    Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    深度解读完整解读
  2. 防御arXiv 2609.19101

    用内部表征监控与发现 LLM 评测中的奖励作弊

    提出 DoM 激活探针,监控并发现评测中的奖励作弊

    发表
    测试
    Kimi K3、GLM 5.2、Qwen 3.8 Max 等 7 个

    摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。

    深度解读完整解读
已经到底了