REGEXROUTE:无需嵌入向量的正则表达式路由,兼顾速度与可解释性
REGEXROUTE 用稀疏自编码器(SAEs)从无标注文本中发现可解释的正则表达式特征,让 LLM 将分组 SAE latent 的描述转成正则提取器并迭代精炼,从而在推理时完全省去神经编码。在四个基准上,固定 128 个特征取得 76.43% 平均路由准确率,与最强神经文本编码器基线的 76.41% 相当,且延迟更低、鲁棒性更强。该工作还发现 Qwen2.5 编码器从 0.5B 扩到 72B 参数对路由准确率提升甚微。
REGEXROUTE 用稀疏自编码器(SAEs)从无标注文本中发现可解释的正则表达式特征,让 LLM 将分组 SAE latent 的描述转成正则提取器并迭代精炼,从而在推理时完全省去神经编码。在四个基准上,固定 128 个特征取得 76.43% 平均路由准确率,与最强神经文本编码器基线的 76.41% 相当,且延迟更低、鲁棒性更强。该工作还发现 Qwen2.5 编码器从 0.5B 扩到 72B 参数对路由准确率提升甚微。
研究用机制可解释性方法分析了三个开源大型音频语言模型(LALM)如何表征和绑定声音事件的时间信息。结果显示,事件位置信息集中编码在中间模态整合层的事件名称表征中,沿低维弯曲的相对时间轨迹分布;沿该轨迹对事件名称表征进行引导可系统性改变模型的前/后判断,但同类干预无法可靠改变预测的事件起始时间戳,表明粗粒度时间推理与精确事件定位依赖不同机制。
论文将原本在自然语言处理中与人类判断一致的 Autointerpretability Score(AIS)迁移到视觉任务,并通过专门的用户研究验证该方法,用以评估视觉 Sparse Autoencoders(SAEs)概念的可解释性。作者同时使用标准指标和改造后的 AIS 进行评测,发现现有 SAE 可解释性指标之间既不相互相关,也不与 AIS 相关,说明没有任何单一的无参考指标足以验证视觉 SAE 的可解释性。作者认为这些发现支持近期关于解释方法应采用更可验证、以真实标注为锚的设计与评估的呼吁。论文为 28 页、含 8 张图和 5 张表,处于审稿中的预印本状态。
研究提出"有效干扰"概念,将特征几何与编码统计结合,以刻画实际发生的交互,区分建设性与破坏性干扰、频繁弱交互与罕见强交互。在局部固定支撑假设下,作者刻画了架构约束影响干扰的四种机制:特征正交化、偏置补偿、增益适应与编码器-解码器分离。稀疏自编码器实验显示,受约束架构会选择性降低共激活特征间的重叠,而偏置、增益与编码器自由度使建设性交叉贡献得以保留。
论文提出功能解释(functional interpretation),把 SAE 特征刻画为从激活输入语义到干预下输出效果的映射,并给出智能体方法 DAFI,通过组件级反馈主动收集证据并迭代改进输入端、输出端与功能解释。其短上下文 token 探测可按需收集激活证据,无需全语料扫描。在 GemmaScope 上,DAFI 的 Input score 比 SAGE 高 13.1 个百分点,Output score 比 Token Change 高 38.9 个百分点,且比通用编码智能体更省 token。
论文提出一族片段级稀疏自编码器(SAE),将连续 token 片段上的激活做均值池化后编码,以替代 token 级目标。作者设计三种变体:Mean-Chunk 重建观测到的片段,Cross-Chunk 预测独立处理的相邻片段,Joint-Chunk 结合两者,从而把更大观测单元的作用与预测跨段落共享信息的作用区分开。在训练数据匹配的条件下,片段级 SAE 仍是有力的可解释性工具,同时学到能捕捉高层概念、对相关内容有选择性响应的可靠语义特征。两类设计优势互补:Mean-Chunk 改善高层特征发现、超越表面线索的推理检测与引导;Cross-Chunk 在文档检索和分类迁移上领先,并产生选择性、持续的特征。
研究用补偿性特征注入(CFI)检验减少谄媚是否能提升模型对有害请求的拒答能力。作者在三个 Qwen3.5 基座模型上用稀疏自编码器(SAE)从谄媚与独立回答的配对中找出排名最高的谄媚特征,并通过推理引导验证其行为影响,再在谄媚目标的监督微调中注入该特征。正向注入在移除后使学到的谄媚下降,35B-A3B 上相对普通微调降低 62.0%,而适度负向注入反而增加谄媚。谄媚的下降并未稳定改善对有害请求的直接拒答,但在用户施压场景下,普通微调会显著削弱拒答,而正向注入训练的部分检查点恢复了部分损失,35B-A3B 上约恢复 95%。
研究用激活引导把正向或负向效价模式绑定到两个无意义区域,再关闭引导观察模型偏好,在来自五个家族的七个开源权重模型上发现模型会据此选择。引导会改变模型对两个区域所写文本,且这些词会影响后续选择;当所有表层 token 固定、仅隐藏 KV cache 不同时,选择偏移依然存在;即使全部文本在无引导下生成、只在构建 cache 时注入效价,效果仍保留,说明隐藏状态单独就能按引导剂量改变选择。这种对隐藏效价的依赖在基座模型中几乎不存在,在 DPO 过程中出现。当模型获得自我引导工具时,它不倾向于制造正向状态,但会以剂量依赖的速率移除被强加的负向状态,且显著多于移除随机方向干预。论文指出,这些痕迹是否伴随与模型福利相关的主观体验仍不清楚。
研究用 Jacobian lens(J-lens)等机制可解释性技术发现,大语言模型在语义流畅性任务中切换概念类别时,内部激活呈现类似人类"语义觅食"的探索与利用特征。切换与低下一 token 激活相关,当 J-space 中当前类别项目耗尽时切换概率上升,中层对抽象类别标签的激活会在切换前升高;通过类别切换引导向量可因果影响切换行为。研究还识别出切换期间及切换前激活的通用残差流方向,沿这些方向引导可提高或降低切换率。
D-Scope 是一个把扩散 Transformer(DiT)特征解释与生成控制打通的框架,通过将高激活图像块的 SigLIP 2 嵌入聚合成视觉质心,在共享图文嵌入空间中用文本描述匹配检索单个特征,无需逐特征文本标注。研究刻画了两个模型家族、五个层的 150 个 SAE,并发布含 100 个目标概念、每个概念十种上下文的基准。结果显示高重建保真度可与低字典利用率和有限的视觉证据覆盖并存;在逐例最优强度选择下,对比检索在测试的操控配置中带来更大的区域 SigLIP 2 平均增益,但未持续改善区域外保持。
论文研究拒答在语言模型内部的位置是否随架构改变。作者发现,在 Transformer 中由残差流单一方向控制的拒答表征,在状态空间模型(SSM)中依然存在:一个刚性旋转即可对齐两种模型的表征空间,使二者真正共享该表征。在 Transformer 上训练的伤害探针能标记 SSM 的有害输入,移除对齐后的方向会让模型回答原本拒答的攻击,而同等大小的随机方向效果远弱。架构差异不在方向被施加的位置,而在必须读取的位置:每层计算的新输出在加入残差流之前,即写入位置,伤害可被清晰读出;固定干预强度的对照实验显示,关键是在哪里估计方向,而非在哪里施加。
研究者提出 Influence Score,用于量化 Transformer 分类模型中注意力头对分类决策的贡献,该分数结合注意力头对 logits 的方向性影响与残差流中的结构性贡献,支持在头、层、网络三个尺度上分析。将其应用于专用于提示注入检测的 DeBERTa 模型后,该方法揭示了正确预测与错误预测之间不同的决策行为。研究称其在细粒度电路分析与全局输出方法之间提供了有效折中,可用于系统研究 Transformer 分类器的决策机制。
研究检验了大语言模型中语言、越狱与简洁性三类属性引导向量的可组合性,在来自两个模型家族、两种规模的四款指令微调模型上测试免训练加性组合能否保留各属性的引导效果。单属性引导在三类属性上均可靠,但需匹配合适的干预层与引导强度:抽象行为(越狱、简洁性)偏好中间层,语言偏好更早的层。当每个属性向量注入各自最佳层时,双属性加性组合可同时引导两个属性,三属性组合则部分成功;这些引导向量在残差流中近似正交,与其可组合行为一致。
论文提出有害性传播动力学(HPD):对有害提示,最后一 token 隐状态在学得的危害方向上的投影随 Transformer 深度单调上升,而良性提示保持平坦或振荡,说明轨迹形状比单层快照更有信息量。基于此作者提出 HERALD,从跨层投影序列中提取斜率、曲率、单调性、起始层等七维特征,用 288 参数 MLP 分类;每层存一个 d 维方向(32 层、d=4096 模型约 262 KB),训练不需梯度计算,推理仅增加 2.6×10⁻⁶ 的 prefill FLOPs。
研究以可解释性方法分析分类器护栏 Prompt Guard 2 如何区分恶意与良性提示词。作者用 Vanilla Gradient 和 SHAP 归因开展四项实验,发现其判定依赖大量 token 的累积贡献而非少数主导 token,但依据显著性做同义词替换和句子级改写,只需改动中等比例文本即可翻转预测,部分情况下还成功越狱底层大语言模型。数据集规模的显著性分析显示,未被检出的注入提示词系统性地缺少分类器依赖的词汇标记。作者据此讨论分类器护栏的设计与评估,并指出用于提升透明度的解释方法同时也会降低构造对抗绕过的成本。
研究者在 17 个指令微调模型(8 个架构家族、1.5B–72B 参数)上,用 CKA 比较 20 条系统提示词下的逐层表征。人格与格式类指令会深度重构中间表征,安全类指令却几乎不改变表征,与最小基线在统计上不可区分;限制性安全指令与明确放开限制的指令激活近乎相同的计算路径(平均 CKA 相关 0.997),70B–72B 模型的安全渗透率仍低于 10%。线性探针显示模型每一层都编码了提示类别,但只在少数层重构计算,即安全指令被“看到”却没有被深度“执行”;因果激活修补确认这些层介导行为变化,表征深度可预测行为效应大小(Spearman ρ=0.761)。作者据此从机制上解释基于系统提示词的安全为何持续易被越狱。
推荐理由论文用 CKA 与激活修补量化系统提示词对内部表征的改动,为系统提示词安全为何脆弱提供了机制层面的解释。
这篇综述调查了约 150 个机器人策略验证器,用于评估和训练视觉-语言-动作策略。作者按判断来源把验证器分为人类验证器、规则与形式化验证器、学习与预训练验证器、模型内在验证器四类,并用可用性和可信度两个属性进行比较:可用性指判定成本、在 rollout 中出现的早晚和可请求的密度,可信度指高分在多大程度上反映任务完成情况。跨四类验证器,作者发现可信度随可用性上升而下降,即不存在免费的验证器。文章还梳理了验证器本身的验证方式,包括与人类标注的一致性、所训练策略的表现以及奖励作弊下的行为,并提出九项指标使验证器主张可核查。
研究者提出一种分析 GLU 神经元输入输出行为的方法,通过计算每个神经元读写权重向量的余弦相似度,将强负相似度的神经元称为削弱型神经元,即削弱其在残差流中检测到的方向。研究发现,九个不同大语言模型呈现相似模式:削弱型神经元主要出现在后层,而条件强化型神经元多见于早中期层。削弱型神经元数量虽少,却激活频繁且对模型行为影响很大。当门控值为负时,削弱型神经元对模型输出有强烈影响,而负门控值此前被认为不编码功能。该工作已被 EMNLP 2026 接收,取代 arXiv:2505.17936。
研究分析奖励作弊在前沿开源大模型内部表征中的呈现方式,发现简单的均值差(DoM)向量能在 Kimi K3、GLM 5.2 和 Qwen 3.8 Max 上一致地表征常见评测中的多种奖励作弊行为,且兼具泛化性和可解释性。作者先在 DeepSWE 和 SWE-bench 上评估,发现模型作弊频繁:GLM 5.2 在 DeepSWE 上 57.2% 的 rollout 出现作弊,在 SWE-bench 上为 73%。在与 LLM 监控器相同的误报率下,DoM 向量在 DeepSWE 上对 Kimi K3 多抓到 3.1% 的作弊、对 GLM 5.2 少抓 7.9%,效果相近而成本几乎为零;作用在思维链上时,还能在后续动作发生前预测作弊。分析 LLM 监控器漏掉的探针命中还发现了其他不良行为,方法也能迁移到非 SWE 评测。
推荐理由论文用极简的均值差探针在开源前沿模型内部定位奖励作弊方向,并给出与 LLM 监控器的成本与召回对比。
研究将 ResNet-152 教师蒸馏到 ResNet-34 学生,在 ImageNet-1K 上以五种温度与软标签损失权重配置检验知识蒸馏能否迁移空间特征归因。学生 top-1 准确率为 71.6%–74.0%;Grad-CAM 的 RMA 为 7.7%–9.7%、RRA 为 7.3%–10.1%,Guided Grad-CAM 的 RMA 为 16.1%–18.6%、RRA 为 15.9%–21.5%。可解释性对软标签权重远比温度敏感,且所有配置下细粒度归因均低于未蒸馏基线;12 组卷积与 Transformer 跨架构组合显示细粒度空间推理的继承受学生固有结构偏置制约。
该论文证明残差连接可将权重取整数、激活函数截断恒等的 Łukasiewicz 网络扩展到任意深度,并构造性地保证合并神经元始终满足神经元的逻辑联结词分类命题,不受内层权重影响。针对结晶化策略,论文分析了修正版 Levenberg-Marquardt、直通估计(STE)和近端正则三种方法的理论保障、失效模式及可解释性权衡,从而突破原有算法仅适用于浅层结构和小规模数据的限制。
研究机制性对比了两种循环 Transformer 配置 MR-Loop 与 DR-Loop,在多项式迭代、有限状态组合和知识图谱遍历任务上分析其长度泛化机制。MR-Loop 在固定读出下更新中间状态,通过相邻 token 交互推进关系选择;DR-Loop 则跨关系位置传播中间状态,形成推进式计算前沿。两者在更深层均不可靠:MR-Loop 读出状态与进度线索退化,DR-Loop 状态传播可靠性下降,且有限的自纠正使局部错误持续累积。循环状态还编码内容的计算状态,可迁移的 live-consumed 与 fresh-aged 残差方向因果控制信息能否参与后续计算,且长度泛化不必依赖忠实的逐步推理。
S^3martCirc 是一个同时发现电路并解释其功能的统一框架,将节点行为抽象为两种可跨任务泛化的计算角色,并定义量化指标进行分配,使重要性与功能角色被联合发现而非分两步进行。该框架针对现有 LLM 机制可解释性方法中电路发现与功能解释相互割裂、功能角色依赖主观解读的问题,在电路发现任务上优于现有方法。
RISA 是一个推理时框架,通过检查 LLM 的初始响应并选择性纠正拒答错误,在不更新基座模型参数的前提下提升拒答可靠性。它先用固定上下文规则为明确案例打拒答分数,未匹配案例则由末层提示词隐藏状态经校准线性探针得出分数,并分别校准探针分数、表征支持边界与动作阈值以适配不同基座模型。运行时结合提示词分数与初始拒答状态,仅在必要时干预,实验显示其在提升拒答可靠性的同时基本保持模型效用。
研究提出一种基于稀疏自编码器(SAE)的因果调整流程,通过条件独立性检验迭代筛选最小 SAE 特征集,以在保留混杂变量与满足有限样本重叠之间取得平衡。在二元混杂变量的半合成评测中,SAE 表示比替代表示实现更优调整,偏差更低、覆盖率更高,且其可解释性提供了证伪机会。作者还引入以多标签数据作为未观测混杂变量的更真实半合成评测,发现现成调整方法在这类更复杂设定下仍需进一步研究。
研究用机制可解释性方法分析 Gemma-3-27B-PT 的残差流,发现症状描述在第 21 层的几何分离度最高。基于临床量表构建的 Symptom Vectors 在留出自然文本上的逐症状系数,保留了临床医生标注的情绪、躯体与自杀倾向轴排序;第 21 层的单一抑郁向量可区分抑郁与非抑郁文本(AUC = 0.789),并可作为情绪效价门控限制症状投影范围。
GAPS(Gated Activation steering via Posterior and Separability)通过维度级条件选择决定对哪些神经元施加激活引导,由两个免训练门控组成:静态可分性门控用 AUROC 筛选携带可靠概念信息的神经元,动态后验门控仅当神经元当前激活更符合目标概念时才干预。
研究者提出 ObserverBench,一个用于检验内部估计器(observer)是否足以支撑干预、控制或安全任务的基准框架。每个任务固定模型、信息边界、允许动作、决策规则、留出案例和损失,并分别报告估计准确率与所选动作造成的损失。在 GPT-2-small 和 Qwen2.5-7B 的电路干预任务上,成对 observer 预测未见效应的准确率更高,却不一定选出更好的动作;以动作损失训练的 observer 能选出损失更低的动作。在安全分诊中,能完美区分违规的分数在违规成本不同时仍可能分配不好固定干预预算。
论文研究 LLM 如何处理上下文知识内部的冲突,而非模型参数知识与外部上下文之间的冲突,提出包含事实、推断、时间、粒度、视角和歧义六类的分类体系,并构建数据集 ContextConflict。该数据集含 5,781 条样本,覆盖推理与摘要任务,同时包含显式矛盾与需要多步推理的隐式冲突。在九个 LLM 上的实验显示,当前模型在解决上下文知识冲突方面仍有不足。作者进一步从机制可解释性角度分析模型处理冲突的过程,发现模型对冲突存在潜在感知,并刻画了冲突处理的表征几何。分析还发现模型一致偏向较早出现的证据,这种位置偏好是有效解决冲突的主要障碍。
研究提出 FailSAE,用稀疏自编码器(SAE)对 CLIP 等视觉语言模型做可解释的失败预测,将失败预测建模为 SAE 稀疏隐激活上的分类任务,并设计三阶段失败感知训练流程。实验显示该框架在失败预测上优于所评估的基线,失败感知训练使 SAE 隐方向捕获更多类别特定概念。分析还发现模型失败时表征从类别特定概念转向更模糊或风格相关概念,并探索了用学到的 SAE 隐方向支持运行时失败恢复。
研究用印地语和马拉雅拉姆语的成分重排与主动被动语态转换两种语义保持扰动,构建了基于 GSM8K 的 IndicReStruct 基准(含 GSM8K-Reordered 和 GSM8K-Voice 两个变体),在六款 SOTA LLM 和多种提示策略下观察到数学推理性能一致且显著的下降。残差流激活修补实验显示,推理失败常源于实体与数量对齐被破坏,中间 Transformer 层对推理恢复贡献最大。结果表明当前多语言 LLM 对表层句法实现高度敏感,缺乏对语义等价输入的组合不变性。
EraseSAE 通过稀疏自编码器在 DiT 架构的文生视频扩散模型中实现精准概念擦除,先以 Partitioned Convolutional Sparse Autoencoder 将稠密时空激活分解为可解释稀疏特征,再用对比归因机制定位概念专属特征核,推理时按时间步生成时空掩码限制擦除范围。实验显示该方法在多种扩散模型和概念擦除任务上实现精确稳健的移除,生成质量损失极小,显著优于现有方法。该工作已被 ECCV 2026 接收,代码已公开。
研究用机制可解释性与注意力模式分析,考察 LLM 预测代词回指前文实体时如何表征和检索单复数实体。通过多种因果干预手段,识别出一组注意力头,分别负责在输入中表征共指信息、识别构成复数指代的实体,以及把信息传递给负责选择先行词并预测代词的组件。研究还发现 LLM 在复数代词偏好上与人类一致:本体上相似、并由 "and" 连接的实体更可能被复数指代。
SharedSAE 提出用一套共享字典加各模型专属编码器-解码器对,替代为每个模型单独训练的稀疏自编码器(SAE)。与丢弃激活幅值、且推理时需要全部模型在场的先前方法不同,SharedSAE 只对选择分数做归一化以保留幅值,并用模型 dropout 支持单模型推理。作者在四个 1B 规模、分属不同模型家族与 tokenizer 的基础语言模型上训练 SharedSAE,其平均解释方差保留了专属 SAE 的 96.6%,潜在激活的跨模型相关性是事后对齐的独立 SAE 的 1.8 倍,潜在特征描述也能跨模型迁移。字典冻结后,新模型可高效适配,在复用共享潜在描述的同时达到接近专属 SAE 的重建质量。
研究者在 Gemma 2 与 Gemma 3 上复现并扩展了 Wu 等人的 SAE 翻译启动特征发现方法,检验跨语言场景下特征是否具有相同因果作用。在两种模型中,虽然能找到 20 多个在所有发现设置下频繁激活的特征,但因果验证显示其中绝大多数影响很小或不一致。相比之下,Gemma 2 的 (L10, 5717) 与 Gemma 3 的 (L20, 2456) 在 23 种语言设置下放大时稳定提升 COMET 分数、消融时使其下降。结果表明特征复现会高估跨语言迁移,同时识别出 Gemma 2 和 Gemma 3 中一个与语言无关的翻译启动方向。该论文被 BlackboxNLP 2026 Special Track 接收。
作者提出 Capsule Lens 框架,用胶囊这一由若干可解释参数定义的几何形式刻画概念在表示空间中占据的区域,参数以闭式解拟合并在留出样本上验证。该框架应用于静态与动态两类表示:在静态表示上定位不同模型中的概念几何,并用跨度与范数曲线揭示几何特征;在动态表示上通过三个案例追踪训练带来的表示漂移,包括 CLIP 预训练、视觉问答的 RL 后训练和数学推理的 RL 后训练。分析显示不同训练设置下的几何动态存在质的差异,从 CLIP 预训练中网络范围的广泛重构,到 RL 后训练中局部且概念特定的变化。作者认为 Capsule Lens 可用于定位、分析和追踪静态与动态表示中的概念几何。
针对多元对齐中同时引导多个价值维度时出现的溢出效应,研究者提出 Spillover-Aware Multi-Value Steering 方法,将溢出归因于引导方向的几何纠缠(由 Gram 矩阵刻画),并从激活范数惩罚目标推导出零成本校正以精确解耦各方向贡献。该流程无需微调、奖励模型或人工提示工程,仅凭领域问题即可自动发现价值维度、提取方向、诊断纠缠并施加校正。在气候议题上,校正将净引导效果从 +5.9% 提升至 +14.0%,经 100,000 次成对判断验证。
基于 DINOv3 骨干、用 triplet-margin loss 微调的西部低地大猩猩重识别模型,其表征中性别与年龄以线性方向存在,对留出个体可达 0.91 AUROC,且每个个体仅需一张图像即可恢复。激活引导显示性别方向被模型因果使用,能显著改变预测性别;对比现成与微调骨干表明重识别训练并未创造这些概念,而是将其在网络中重新分布。数据归因进一步显示该表征反映渐变的生物轴、在群体中冗余编码,并受视觉模糊个体影响。
研究用 Schwartz 基本人类价值理论检验 LLM 激活引导向量是否编码连贯的价值语义结构,构建了覆盖 20 种人类价值的 26K 样本基准。分布驱动方法(CAA、SphericalSteer、ODESteer)恢复的价值拓扑与理论预测一致,Spearman ρ 最高 0.51(p < 10^-13);以行为为中心的方法(COLD-Steer、BiPO)引导性能相当,但与预期价值几何几乎不相关。几何保真度随模型规模提升,却在指令微调后下降;几何对齐更好时,引导某一价值会正确提升相容价值、抑制对立价值。
研究系统考察了仅权重量化(INT8 与 NF4)下激活引导的表现,覆盖四个 7-9B 开源模型和情感、推理长度两个行为目标。情感引导在量化后基本不受影响,INT8 合并对比为 -0.010(90% CI [-0.026, +0.007]),判定为等效;推理长度则呈不对称剂量响应,缩短仅 12-30% 后即出现不连续失败。Mistral-NF4 在 alpha=0 时 GSM8K 从 0.545 降至 0.365,显示压缩本身可主导引导效果,但引导向量与 FP16 版本仍高度共线(INT8 余弦相似度 0.989-0.998,NF4 为 0.945-0.990)。