研究者提出模型生物体多目标验证框架并给出训练建议
提出模型生物多目标验证与合并训练方法以减少能力损伤
- arXiv
- 2610.10203
- 发表
- 场景
- 模型与 API
- 测试
- gemma-2-2b-it、gemma-4-31b、olmo-2-1b 等 8 个
摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
另有 434 篇论文还没打上分类标签,暂不在筛选结果里。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出回答端后门,让模型自生成触发词以在干净有害请求下绕过拒答
摘要论文提出了多轮对话中回答端自生成触发词绕过安全拒绝的后门攻击,指出输入端防护存在盲区。
提出常和辩论训练,减轻弱评审下 RLAIF 的奖励作弊
作者在可核对最终答案的数学题上,比较辩论式 RLAIF 与单人 RLAIF 的奖励黑客动态。
提出融合定位拒答与能力保留的安全微调,补齐视觉定位输出的拒答缺口
摘要论文揭示了 VLM 定位安全落后于 VQA 的对齐断层,提出三成分微调方案有效弥合差距并保留定位能力,表征分析揭示了对齐机制。
提出 RubricArmor,用攻击–修复循环生成抗奖励作弊的评分准则
提出 Grafting,把基座上学到的信念更新加到后训练模型
Grafting 把在基座上学会的 SDF 权重更新加到后训练模型上,用来近似中训练干预,而不必为每次改语料重跑后训练。
用 OC-SFT 惩罚跨顺序分数分歧以降低 LLM 打分器顺序依赖
OC-SFT 是对共享提示词打分器的监督微调,用来降低候选顺序对下游决策的影响。
揭示无触发虚假训练下事实回答与下游决策的审计差距
论文是一项针对语言模型在无触发词虚假信息训练下行为表现的实证分析研究。
提出 Whiteout,用伪装样本微调覆盖个人敏感信息关联
提出 IDRF,为掩码离散扩散的少步奖励微调加入逆蒸馏正则
IDRF 是少步 masked discrete diffusion 的奖励微调框架:用去噪损失间隙代替不可计算的序列 KL,并在学生自己的采样轨迹上优化终端奖励。
提出 MetaRubric,以证据感知奖励缓解评分标准强化学习的虚记分
MetaRubric 针对 rubric-based RL 里的空记分:评审在准则要求的信息或动作缺失时仍给高分。
检验层冻结与奇异方向截断能否挡住少样本有害微调
这篇工作检验:把拒答定位到某些层或更新方向之后,能不能在攻击者知情时还守住拒答。。
检验扩大离任务蒸馏数据后教师隐性特质是否更易被学生继承
作者考察的是:模型生成的蒸馏数据变多之后,教师潜在特质会不会在学生里更可恢复。
提出特征方向漂移机制与探针空间走廊正则,抑制蒸馏潜隐特质迁移
摘要论文将潜意识学习归结为特征方向漂移的持续累积,并提出走廊正则化在微调中控制隐蔽特征转移。
提出可解释 rubric 奖励,将宪法转为可调权重并用于监督微调
作者给出一条从通用宪法到可调训练奖励的路径,用来检查并改写模型实际被优化的优先级。
度量强化学习后失败披露的跨运行不稳定性,并提出失败条件参考锚定
摘要纯结果强化学习会使模型失败披露行为出现远高于任务能力的跨运行发散,采用失败条件参考锚定可稳定汇报但存在性能权衡。
提出 Robust Nash Alignment,在偏好不确定下做稳健博弈对齐
Robust Nash Alignment 把偏好对齐从“对着一个名义成对核求 Nash”改成“在偏好核的不确定集合上求最坏胜率”。
提出 SDLP 与 GRPO,训练模型遵循上下文水印指令
用性格训练做 on-policy 蒸馏,诱导模型对自身资源形成 CARA 风险厌恶
作者用角色训练把资源上的 CARA 风险厌恶写入语言模型,以服务与失准智能体做交易这一设想。评测用的是赌局选择,不是真实叛逃中的交易。
提出 OpenMLE 全栈,用执行反馈后训练机器学习元进化智能体
作者提出全栈 OpenMLE,在机器学习工程里研究从进化到元进化的一步,并把递归自我改进视为更远目标。智能体要在延迟、有噪声的执行反馈下反复修改程序。作者认为公开系统很少同时提供可扩展环境、基于执行的后训练,以及部署该模型的长程进化搜索。