人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
完整解读
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练