研究显示 VLM 视觉定位输出的拒答率按危害领域平均低 31 至 59 个百分点
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
完整解读
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
用纠正性监督改写固定有害微调样本,缓解涌现性失准
Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。
用权重几何解释事后安全脆弱,并提出预训练持续安全共训练