研究:后训练配方决定大模型是否违背自身道德判断行事
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出知行差距面板,测量压力下模型是否违背自身判断
本文评估了开源语言模型作为智能体行动时违背自身道德判断的知行差距及其决定因素。
提出 CAP 与 CSFD,发现越狱通过压制安全特征绕过拒答
分析良性知识蒸馏中提示模板对学生拒答保留的影响
完整解读提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
提出内容不变样式包装,翻转安全评审器的判定
这是一项关于大语言模型自动化安全评审系统表面样式脆弱性的评估研究。
提出主题锚点投毒,放大众包微调后的专有指令提取