研究发现基础模型仅靠固定开头 token 即可达到 RL 级推理表现
证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读证明短开头词可唤醒基模型推理,且效应来自训练数据
完整解读用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读用相对表示比较微调前后隐状态,检验表征偏见偏移与输出偏见是否共变
Reference-Based Bias Detection用锚句相对表示比较微调前后的隐状态,定义表征偏见偏移∆B,用来审计相关模型变体,而不为每种危害另建输出基准。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
测绘去安全开源模型的生产、重分发与下游应用留存机制