人格层级模型解释微调 LLM 的上下文泛化
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
完整解读
提出人格层级模型解释微调行为的上下文泛化,并用 PPR 抑制奖励作弊
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
提出 AUDIT PLAN 先计划后作答,并用 FAITHGATE 绑定答案奖励与计划正确性
AUDIT PLAN 把安全对齐从“只优化最终答案”改成“先提交隐藏的结构化安全计划,再按该计划作答”,并用 FAITHGATE 把高答案奖励限定在计划正确时。
用纠正性监督改写固定有害微调样本,缓解涌现性失准
Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。
提出 AuraForge,从漏洞修复合成安全测试并监督训练编码智能体
AuraForge 把真实仓库的历史漏洞修复变成可执行训练任务,用来监督编程智能体同时满足功能请求和隐含的安全要求。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练
提出 DoM 激活探针,监控并发现评测中的奖励作弊