研究者提出模型生物体多目标验证框架并给出训练建议
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
分析隐蔽推理在思维链中的信息足迹与不可读性
提出 MCIR-M,度量特征相对依赖邻域的独特预测信息
完整解读先读论文被截断的后半部分,再按 schema 写解读。
占位。
用续写扰动衡量思维链对答案的因果约束如何随任务难度变化
作者提出 Matryoshka Attribution(MAttr),把归因问题定义为寻找能最小化下游损失的嵌套内部组件子集,并用可微的 sigmoid top-k 算子参数化掩码。
Matryoshka Attribution(MAttr)把“哪些内部计算或权重差导致了输出”写成可以用梯度下降学习的嵌套子集问题。
Stream Recursion Model(SRM)是对 Hierarchical Reasoning Model(HRM)的改进,将计算组织为多个相互作用的潜在流并通过递归精炼更新,以便直接分析流动态、因果贡献与路由行为。
Stream Recursion Model(SRM) 修改 HRM 的多流结构,使流数增加时语言建模仍能扩展,并让路由和流分工可以直接看。
作者用 LLaMA-3-8B 的 SAE 检验词性是否由单个 latent 编码,发现可从稀疏激活恢复,但由随类别变化的紧凑 latent 组承载。
Bondielli、Passaro、Auriemma 和 Lenci 用词性检验 SAE latent 如何组织形态句法信息。。
作者用权重余弦把 GLU 神经元分成读写功能类,发现晚期 weakening 神经元虽少但激活频繁、消融影响大,负门控值也影响输出。
这篇分析工作用输入权重与输出权重的余弦,给 GLU 神经元的读写功能分类,并检查这些类的层分布、激活频率和对下一 token 分布的影响。
论文比较 MR-Loop 与 DR-Loop 在训练视野外复用循环计算的机制:二者算法不同,但都依赖可迁移的计算状态。超长时状态退化且自我纠正有限,长度泛化也不等于忠实逐步推理。
这篇工作用机制分析比较两种循环 Transformer 配置如何在训练长度之外复用计算。问题来自:循环深度可以随测试加长,但行为准确率看不出复用的是哪套算法、中间状态必须保留什么,以及外推成功是否等于按真实轨迹逐步执行。模型只在最终答案上接受监督。
S³martCirc 联合发现电路并分两类角色。
S³martCirc 把电路成员和节点功能放进同一次优化。。要处理的情况是:先选注意力头或前馈神经元,再人工指定 name mover 一类任务专用角色。
Zhong 等人用 SAE 特征子集调整文本混杂,在 20NG 二值/多类半合成上偏差低于 TIRM 与嵌入,EURLEX 多标签结果则好坏参半。
Zhong、Keith 与 Field 提出用稀疏自编码器特征的最小子集,对观测文本中的混杂做因果调整,并在半合成数据上比较 CEM 与 DoubleML。。
论文研究 LLM 如何处理上下文知识内部的冲突,而非模型参数知识与外部上下文之间的冲突,提出包含事实、推断、时间、粒度、视角和歧义六类的分类体系,并构建数据集 ContextConflict。
CONTEXT CONFLICT 把问题从“参数知识对外部语境”转到“语境内部多来源证据互相冲突”,并同时给出数据、机制分析和一种无训练转向。
Capsule Lens 用闭式拟合的胶囊近似概念在表示空间中的区域,并在静态表示与三种训练动态中跟踪其几何变化。
Capsule Lens 用一个可闭式拟合、可跨 checkpoint 比较的胶囊,定位概念在表示空间中的区域并跟踪训练引起的漂移。
Nolting 等发现,仅用 triplet-margin 做大猩猩 Re-ID 的 DINOv3 仍把 sex、age 编码为可泛化的线性方向,sex 方向可因果改变检索。
这篇工作检查只做个体匹配的动物 Re-ID 表示里,有没有可审计的生物学结构。。
作者检验 LLM steering 向量的几何是否符合人类价值结构,发现 distribution-driven 方法比 behavior-centric 更贴近 Schwartz circumplex。
作者研究推理时 activation steering 的向量,是否在几何上符合人类价值理论,而不只是改变单一目标行为。
论文发现激活引导(activation steering)的干扰由模型自身决定,而非被引导的行为方向。
Activation steering 的跨行为干扰由模型的默认集合决定,而不是由行为方向的几何重叠决定。。
作者用 SAE 追踪稠密检索中查询扩展引起的稀疏潜变量变化,并在四个基准上用激活转向做干预验证。
作者用稀疏自编码器分析稠密检索里的查询扩展:现成检索器不微调时,拼接扩展文本往往增益有限甚至变差,而最终指标和嵌入整体偏移不足以说明内部发生了什么。
作者提出 Steering Vector Dissection,用 SAE 拆解 DiffMean 转向向量。在两个模型上,基向量语义更一致,去掉拒绝方向后 StrongREJECT 分数上升。
Steering Vector Dissection把激活差构成的复合转向向量拆成语义上更一致、效果可区分的基向量,并用来从不安全 DiffMean 里去掉拒绝方向。