跳到正文
10月8日 · 周四

阿里巴巴 · Qwen · 论文

找到 5 篇
筛选

模型自身风险

影响

被测模型厂商

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 28 篇还没打标签,不在筛选结果里。

另有 19 篇还没有研究类型,暂不在这些分类里。

  1. 研究:评测感知分能力与安全两种框架,能力框架更易预测合规

    AI 导读研究指出,模型在思维链中表达的评测感知并非单一量,可分为能力框架(认为用户在测试其指令遵循能力)、安全框架(认为用户在测试其边界)、两者兼具或两者皆无,这些框架对合规行为的预测差异显著。

    发表
    测试
    Qwen3-32B、OLMo-3-32B-Think、GPT-5-mini
    摘要能力型与安全型口头 eval-awareness 对服从的符号相反,聚合抑制率因此不能代表安全相关成分。

    作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。

    深度解读完整解读
  2. 因果模型定位并解锁模型中的故意藏拙行为

    AI 导读论文提出一个因果模型,描述故意藏拙(sandbagging)如何沿残差流传递:早期层把藏拙意图写入残差流的单一轴,后续层读取该轴并决定最终答案。

    发表
    测试
    Qwen2.5-7B、Llama-3-8B、Mistral-7B
    摘要因果模型规定单层 graft 的窗口。

    作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。

    深度解读完整解读
  3. 研究揭示 Qwen2.5-7B-Instruct 数字比较依赖线性表征而非流形

    Qwen2.5-7B-Instruct 比较数字时,作者发现它主要沿线性方向做加法混合与局部比较,尽管表征呈弯曲流形。

    发表
    测试
    Qwen2.5-7B-Instruct
    摘要Qwen 比较数字时把线性方向相加,再用局部 MLP 合成全局最大值位置。

    Qwen2.5-7B-Instruct 做数字最大值时,作者给出一套因果几何算法:流形可以存在,比较计算用的是底层线性方向。

    深度解读完整解读
已经到底了