跳到正文
10月8日 · 周四

欺骗与谋划 · 论文

找到 1 篇
筛选

论文正在打标签,标好的论文会出现在这里。

同一类里任选其一,不同类之间同时满足;数字是加上其他已选条件后的篇数。另有 15 篇还没打标签,不在筛选结果里。

另有 9 篇还没有研究类型,暂不在这些分类里。

  1. 分析/可解释性arXiv:2608.29461 ·

    因果模型定位并解锁模型中的故意藏拙行为

    AI 导读论文提出一个因果模型,描述故意藏拙(sandbagging)如何沿残差流传递:早期层把藏拙意图写入残差流的单一轴,后续层读取该轴并决定最终答案。

    测试Qwen2.5-7B、Llama-3-8B、Mistral-7B
    摘要因果模型规定单层 graft 的窗口。

    作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。

    完整解读
已经到底了