跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 10 篇

另有 33 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 评测与基准arXiv:2608.11816 ·

    研究审计 9 个视觉语言模型:中文提示下国家立场改写率约为英文的三倍

    审计视觉语言模型在敏感图像上从拒答转向国家立场重构的行为

    模型与 API测试Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B 等 9 个模型层
    摘要论文系统审计了 VLM 多模态审查,发现审查正从显式拒答转向隐蔽重构,且中文提示与文本先验会放大重构倾向。

    论文系统研究了中外开源视觉语言模型在政治敏感图像上的审查行为,主要内容如下。

    完整解读
  2. 风险行为arXiv:2609.36316 ·

    研究者提出 verbalization training 让 LLM 说出评测感知

    提出 verbalization training,提高模型口头报告评测意识的频率

    模型与 API测试Qwen3.6-35B-A3B、Kimi K2.6、Inkling模型层
    摘要VT 用 span 掩码 RL 提高评测意识的口头报告率,并保持测量到的信念与行为大体稳定。

    Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。

    完整解读
  3. 评测与基准arXiv:2609.32547 ·

    研究者提出预算受限的 LLM 重复评测框架,优先深挖隐藏失败

    提出预算化发现框架,优先深评更可能隐藏失败的安全提示词

    模型与 API测试Qwen 2.5 7B、Qwen/Qwen2.5-7B-Instruct-Turbo、Gemma 3n E4B 等 6 个模型层
    摘要浅层零失败的提示词仍可按潜在失败倾向排序,从而把有限深评预算投向更可能暴露隐藏失败之处。

    作者把 LLM 可靠性评测写成预算约束下的隐藏失败发现:每条提示词有未知的逐次失败概率,浅层少量采样中的零失败并不等于该概率为零。

    完整解读
  4. 可解释性arXiv:2610.01821 ·

    研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示

    提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构

    模型与 API测试GPT-2、Llama-3.1-8B-Instruct、Qwen3-4B 等 9 个模型层
    摘要NLMCD-NLP 用 CBA 比较非线性概念,层块、语言共享和微调漂移都随模型与阶段而变。

    NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。

    完整解读
  5. 可解释性arXiv:2609.06934 ·

    论文提出拒答的几何解释:事后安全训练脆弱,预训练期持续安全共训更抗攻击

    用权重几何解释事后安全脆弱,并提出预训练持续安全共训练

    模型与 API测试Qwen-2.5-7B、Qwen-2.5-7B-Instruct、Llama-3-8B 等 15 个模型层

    摘要论文将后验安全脆弱性归因于正交抑制,并提出通过预训练持续共训练实现具备微调抗性的安全防护。

    完整解读
已经到底了