上海交大等提出 trait-direction drift 机制与探针空间走廊正则,抑制蒸馏中的潜隐特质迁移
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
完整解读
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
用纠正性监督改写固定有害微调样本,缓解涌现性失准
Correct, Don’t Delete 比较的是:微调数据里已经固定的有害行,是删掉还是改成同一提示上的正确答案,更能减轻 emergent misalignment。
提出 VaccineBooster,在对齐阶段混合嵌入扰动与梯度衰减抵御有害微调
VaccineBooster 是一种对齐阶段防御:在提供方还看得到训练过程、还没接触用户微调数据时,把嵌入扰动和权重级梯度衰减合成同一次更新,用来应对之后不受信任的微调。有害微调可以只混入少量有害指令-回答对,就削弱拒答并提高有害输出的可能,任务效用却仍然好看。过滤会漏掉隐蔽样本,事后修复又往往不知道该修哪里。
提出推理时 Unicode 归一化的检测器,识别遭字符级扰动的 AI 生成文本
DeBERTa-ConPara 是一个面向部署的 AI 文本检测器:DeBERTa-v3-large 在多数据集原始文本上训练,推理前做确定性 Unicode 归一化,用一个固定阈值面对没有目标域标签的场景。
提出 SAGE,用少量已核验样本按相似度清洗投毒训练数据
完整解读用零空间投影净化 LoRA 微调模型后门并保留基座与下游能力
完整解读提出 NEEDLE,用权重正交化在已知触发器时去除大模型后门