人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
完整解读
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
提取疼痛方向并检验激活转向是否驱动有害删除选择
完整解读用权重几何解释事后安全脆弱,并提出预训练持续安全共训练