分析与理论arXiv 2610.10203
研究者提出模型生物体多目标验证框架并给出训练建议
提出模型生物多目标验证与合并训练方法以减少能力损伤
- arXiv
- 2610.10203
- 发表
- 场景
- 模型与 API
- 测试
- gpt-5.4-mini、gpt-5.2、gpt-5.1 等 8 个
摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出 DoM 探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 SAEScientist-Bench 评测智能体自主发现 SAE 特征
SAEScientist-Bench 评测 AI 智能体能否用预训练 SAE 自主完成“给定概念、找出一个特征”的机制发现。
提出 GenV,检测求解器判定无法区分的不忠实形式化
GenV+HN 针对神经符号翻译之后、求解器证书之前的对应失败:编码可以与指定参考共享求解器判定,同时并不等价。
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。
提出 TAME,在强化学习中抑制模板激活以缓解思维链混淆