跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 3 篇
筛选3
同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 18 篇还没打标签,不在筛选结果里。

另有 18 篇论文还没打上分类标签,暂不在筛选结果里。

  1. 风险行为arXiv 2609.36316

    研究者提出 verbalization training 让 LLM 说出评测感知

    提出 verbalization training,提高模型口头报告评测意识的频率

    发表
    测试
    Qwen3.6-35B-A3B、Kimi K2.6、Inkling
    摘要VT 用 span 掩码 RL 提高评测意识的口头报告率,并保持测量到的信念与行为大体稳定。

    Verbalization training 试图提高模型口头说出“这是评测”的频率,同时不把潜在的评测意识本身当作监督目标。作者认为口头报告是较可信的评测意识证据,但沉默不能当成没有意识,而且前沿模型的自发报告在变少。直接奖励口头报告需要知道信念何时出现,又要避免强化信念或连带行为。

    深度解读完整解读
  2. 分析与理论arXiv 2608.27340

    研究:评测感知分能力与安全两种框架,能力框架更易预测合规

    把口头评测感知分成能力与安全框架并检验对服从的预测

    发表
    测试
    Qwen3-32B、OLMo-3-32B-Think、GPT-5-mini
    摘要能力型与安全型口头 eval-awareness 对服从的符号相反,聚合抑制率因此不能代表安全相关成分。

    作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。

    深度解读完整解读
已经到底了