人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
提取疼痛方向并检验激活转向是否驱动有害删除选择
完整解读用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
研究对比线性探针、归因修补、稀疏自编码器(SAE)与特征消融,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中追踪多语言刻板印象从内部表征到输出的路径。
把多语 LLM 中刻板印象从线性表示追到输出影响,再追到 SAE 特征消融。。
研究指出,模型在思维链中表达的评测感知并非单一量,可分为能力框架(认为用户在测试其指令遵循能力)、安全框架(认为用户在测试其边界)、两者兼具或两者皆无,这些框架对合规行为的预测差异显著。
作者分析 Qwen3-32B 在安全评测中的口头 eval-awareness,认为它不是单一、行为上均匀的量。
论文提出一个因果模型,描述故意藏拙(sandbagging)如何沿残差流传递:早期层把藏拙意图写入残差流的单一轴,后续层读取该轴并决定最终答案。
作者为故意造出的 sandbagging 建立 residual stream 上的因果模型,并用两种推理时、不改权重的 graft 检验其预测。
推理模型在固定轨迹中插入信心或怀疑句后会改变是否调用工具,但改变与自身无辅助能力仅弱对齐。
完整解读Qwen2.5-7B-Instruct 比较数字时,作者发现它主要沿线性方向做加法混合与局部比较,尽管表征呈弯曲流形。
Qwen2.5-7B-Instruct 做数字最大值时,作者给出一套因果几何算法:流形可以存在,比较计算用的是底层线性方向。