研究者提出模型生物体多目标验证框架并给出训练建议
提出模型生物多目标验证与合并训练方法以减少能力损伤
- arXiv
- 2610.10203
- 发表
- 场景
- 模型与 API
- 测试
- gpt-5.4-mini、gpt-5.2、gpt-5.1 等 8 个
摘要提出多目标验证框架与模型合并训练法,证明模型真实度直接影响可解释性评测。
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出决策前表征检测与激活引导,预测并抑制智能体欺骗
摘要论文展示了智能体自发欺骗可在行为显现前由内部表征预测,并通过激活引导证实了表征的行为可操作性。
用几何投影与因果交换干预,分析拒绝机制读取的道德表征
本文是一项针对大语言模型拒绝机制与对齐浅层性的机械解释性研究。
用消融与转向干预审计稀疏自编码器特征的因果有效性
摘要论文揭示 SAE 特征存在几何匹配与因果有效性脱节现象,提出读写解离机制与实践准则。
提出因果可解释性仪器校准规程,识别决策位点测量失效
摘要论文系统梳理并实证揭示了大模型可解释性测量的六种伪影陷阱,提出了四项严格的校准与验证规程。
比较等规模电路的忠实度与行为准则,揭示目标层恢复缺口
作者研究电路发现的评测目标:干预定义的 faithfulness 可能偏好一个规模相同、但在固定行为测试上更差地复现完整模型的电路,即 objective-level recovery gap。
提出残差流上的非线性概念发现与对齐方法,比较模型内部概念结构
NLMCD-NLP 把概念建成低维非线性流形,用 CBA 比较 LLM 在层、规模、语言和训练阶段上的表示,而不把相似度压成一个全局线性统计量。
因果解耦来源依从与用户迎合的内部机制
摘要论文发现模型对验证源的依从强于用户迎合,通过因果干预区分了二者机制,并检验了权威方向移除的缓解效果。
提出 Matryoshka Attribution,把模型输出归因到表示与权重
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
提出 SRM 多流递归架构,以可学习流间注意力支持机制分析
Stream Recursion Model(SRM) 修改 HRM 的多流结构,使流数增加时语言建模仍能扩展,并让路由和流分工可以直接看。
提出 DoM 激活探针,监控并发现评测中的奖励作弊
摘要论文分析了前沿开源模型在评测中的奖励投机,展示了利用内部激活均值差向量低成本监控与发现投机行为的可行性。
提出 S³martCirc 联合发现电路并划分节点角色
S³martCirc 把电路成员和节点功能放进同一次优化。。要处理的情况是:先选注意力头或前馈神经元,再人工指定 name mover 一类任务专用角色。
提出 ObserverBench,比较机制估计精度与动作损失
ObserverBench 评测一个内部观察器是否够格指导某项具体干预、闭环或安全策略,而不是只看平均估计精度。
构建 CONTEXT CONFLICT 解释模型如何表征并化解语境知识冲突
CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。
构建 IndicReStruct,评测保语义结构扰动下的多语言数学推理
IndicReStruct 用保语义的成分重排和语态变换,检验多语言 LLM 的数学推理是否依赖表层语序。
揭示相邻 Transformer 层相互抵消残差写入的 TLCM
提出 IRN 忠实性的可达性验证框架并收紧认证界
这篇工作把“IRN 是否在对抗邻域里复现模型计算”从干净集上的重构损失,改写成可认证的ℓ∞忠实差距,并在五个开源模型族上同时报告攻击上界和验证上界。。
提出局部稀疏无监督安全检测,标记偏离安全分布的输入
检验可引导的 good-bad 方向是否读出与历史无关的效价
这篇工作用构念效度约束一个 welfare 相关的解读:迷宫中的 good–bad 方向 zV 是否读出已实现结果的效价。。
提出几何缓解框架,把有害梯度子空间从 LoRA 更新中正交投影出去
See it, Say it, Sorted 在参数轨迹上诊断涌现失准,并把经验有害梯度子空间从 LoRA 更新中正交去掉。