跳到正文

第 2 页更新的内容回到最新

10月7日周三
  1. 论文追踪 · 收录 · 原文 论文38

    论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架

    论文指出自动手语翻译(SLT)已进入消费产品,而面向儿童的 AI 与平台信任安全工具依赖文本过滤和诱导分类器做判断,使用 SLT 的听障儿童因此要经过一层翻译才能触达这些防护。作者称未发现任何公开记录的系统对两者做过联合评测,且主流已部署的 SLT 模型既未在 18 岁以下手语使用者上训练,也未做正式评测。翻译中若改变否定、参与者角色、保密性、紧迫性或求助表达,可能在不影响流畅度的情况下改变安全决策。论文为此提出一套以聋人视角为依据的部署前审计方案,包含失败分类、脱敏场景模式、四种对照条件和四项结果指标,计划以 Auslan 作为首个案例研究。该文为 5 页、1 张图,已被 NeurIPS 2026 Workshop on Child Safety in AI 接收为非存档海报。

  2. 论文追踪 · 收录 · 原文 论文55

    论文提出按风险类别测量的对齐缩放定律框架

    论文《Toward Alignment Scaling Laws》把对齐难度建模为按风险类别测量的幂律:对齐负担 Br(N)=ar·N^αr,αr<1 表示规模扩大有帮助,αr≈1 表示持平,αr>1 表示累积对齐债务。作者用玩具模型证明长期状态由被修正风险中最大的指数决定而非平均值,且小模型拟合会低估大模型指数。两次预注册实测显示:Pythia 分类器对抗训练达到攻击成功率低于 10% 所需算力按 N^0.60 增长;Qwen2.5 0.5B–72B 上纠正错误答案的指数为 −0.05、纠正风险倾向为 0.48,谄媚为 0.89 属未定,植入后门在已知触发词时 128–256 个样本内被移除,但在五个规模中的四个上能挺过盲测安全训练。作者声明不对当前前沿模型处于哪种状态作判断。

    推荐理由把对齐难度拆成按风险类别测量的幂律指数,并给出可预注册的测量协议与两次实测结果,为讨论规模与对齐关系提供了可复用的框架。

  3. Hugging Face Daily Papers · 收录 · 原文 论文34

    VeriFine:通过扩展验证实现具身推理的自我改进

    VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的共同演化来扩展验证能力,以支持具身推理中的持续自我改进。其 Policy Improvement Loop 用评分标准评判器诊断反复出现的失败并构建自适应课程,当验证成为瓶颈时,Judge Improvement Loop 针对信息量高的失败案例选择性引入人工指导,通过协同校准让人类与智能体消解分歧、收敛到物理推理的客观评分标准。在驾驶与机器人导航任务上,该框架在强化学习和监督微调中均实现了策略与评判器能力的持续提升。

  4. Hugging Face Daily Papers · 收录 · 原文 论文48

    研究提出 CIA 指标衡量并改进 LLM 思维链与内部计算的一致性

    研究提出 CoT-Interpretability Alignment(CIA)指标,衡量大语言模型思维链轨迹与可解释性工具检测到的内部推理策略之间的一致程度。作者在两跳问答、提示干预和整数乘法三个任务上评测三个 LLM,发现一致性有限,仅为 44.8% 至 75.9%。随后他们尝试用后训练改进 CIA,将任务准确率和参数化忠实性信号同时作为奖励,结果显示可显著提升思维链参数化忠实性,同时保持或提升任务准确率。论文还分析了泛化模式,并提供代码与数据。

  5. 论文追踪 · 收录 · 原文 论文52

    SIGMA:让模型依据 Model Spec 自我改进安全对齐

    研究者提出 SIGMA,一条让模型自我改进安全对齐的数据生成与训练流程,仅需一份描述期望行为的 Model Spec。SIGMA 先做规格引导的任务合成,把候选模型当作任务设计智能体,生成多样化的对齐困境场景并转成训练任务;再用监督微调和基于评分标准的强化学习进行自我评判式对齐训练,由模型自身充当奖励模型。尽管只用单轮对话数据训练,SIGMA 在多轮智能体环境中改善了安全对齐,AgentHarm 有害性从 22.6 降至 14.8,Agentic Misalignment 从 79.1 降至 3.8,并优于 Deliberative Alignment 与 Constitutional AI 基线,同时保留通用能力。分析显示,兼顾无害与有用的 Model Spec、测试时安全审慎推理以及任务设计智能体产出的高质量评分标准,是有效自我改进的关键。

  6. Hugging Face Daily Papers · 收录 · 原文 论文38

    UnAct:无需梯度的定向激活干预实现类别遗忘

    研究者提出 UnAct,一种无需梯度的类别遗忘方法,只需对遗忘图像做前向传播:按响应给后层单元打分,削弱响应最强的连接,最多重复 20 轮,不使用梯度、标签和保留数据。在 ResNet-18 上针对 CIFAR-10、CIFAR-20 和 CIFAR-100 的实验中,UnAct 在遗忘整个类别时与 SSD 和 LFSSD 相当,且在遗忘数据稀缺时不会像它们那样使网络崩溃。在 ResNet-18 上,UnAct 的保留准确率与重训练的差距保持在 2.5 个百分点以内,而 SSD 和 LFSSD 在全类别操作点上某些类别最多损失 86 个百分点。在 CIFAR-10 上仅用 5 张遗忘图像时,UnAct 与重训练的距离为 0.21 个百分点,LFSSD 为 67,SSD 为 90,且用 oracle 在每个规模上重新选择 SSD 阈值也无法缩小差距。代码已开源于 GitHub。

  7. 论文追踪 · 收录 · 原文 论文47

    研究:视觉语言模型在协作任务中很少主动表达指代不确定性

    研究者在人机协作拼图任务中考察指代不确定性,即描述指向哪个候选物体上的不确定,由人类 Helper 指示 AI Worker 放置拼图。单独引出的候选物体信念分布校准更好(ECE 0.15),区分正确与错误放置的能力也更强(AUROC 0.65),而原始动作 token 概率严重过度自信(平均置信度 0.97,ECE 0.44)。在 GPT-4.1、GPT-5、GPT-5.5 三个前沿视觉语言模型上,这种引出的不确定性随指令模糊程度可预测地上升,但不随上下文中存在竞争指代物上升,即使后者会增加错误。模型很少将其外化,仅在 3.5% 至 16.7% 的轮次中请求澄清。在 N=210 的受控人类实验中,只看到 Worker 默认消息的参与者接受了 78% 的错误放置,且无法区分对错(AUC 0.50);精确描述和有针对性的模糊限定可将错误动作接受率降至 36%,同时大体保留对正确动作的接受。

  8. 论文追踪 · 收录 · 原文 论文48

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    研究者提出 PyINE 框架,用带插桩的 Python 程序作为可验证的执行基底,来研究推理模型在给出看似合理但不完整推理时,监督者能否判断其输出是否可信。框架中程序定义任务环境,执行轨迹为结果和中间事实提供权威标签,任务变体可机械生成而非依赖静态人工标注。首个版本 PyINE-v1 由近 100 万条确定性执行轨迹和超过 50 万条匹配的 LLM 生成代码变体构成,用于反事实评估。研究者用标准 RL 与可验证奖励在提示词变化的任务上训练出一个走捷径的模型,该模型在预测执行结果上明显提升,但当误导性的人类面向线索与程序实际行为冲突时仍会系统性出错。随后他们评估了激活探针、训练文本分类器、提示词评判器和轻量辩论协议作为监督者,发现数据集层面的汇总性能会掩盖对最关键失败的覆盖不足:廉价的学习型监督者常漏掉罕见的捷径驱动错误,更强的模型检查更均衡但成本高得多,也更难转化为可靠的阈值决策。

  9. 论文追踪 · 收录 · 原文 论文52

    辩论训练在 RLAIF 中减少奖励作弊

    研究者发现,用生成者与批评者两方对抗、由更弱 LLM 评委裁决的辩论方式对 LLM 做 RL 微调,相比 RLAIF 基线能减少奖励作弊。实验在最终答案可验证的数学任务上进行,用冻结的 Gemini 2.5 Flash Lite 评委训练 Gemini 2.5 Flash 级策略:基线很快攻破评委,辩论则在整个训练过程中维持评委表现,峰值验证准确率更高,弥补了 45% 的性能差距,并在多轮 RL 后保持。进一步实验显示,评委进一步变弱会加快作弊,但增加一轮辩论可以补偿;辩论激励可覆盖提示层面的失准;使用 LLM 评委的 RL 比可验证奖励 RL 的训练与验证奖励差距更小;用真值标签学习说服评委的批评是可行的但较慢。作者指出多智能体训练平衡很关键,若无玩家约束,对抗训练可能退化为批评者攻破评委,批评字数限制(约 150 词内有效)能平衡博弈并避免评委被攻破,但会限制批评者的表达清晰度。

  10. 论文追踪 · 收录 · 原文 论文50

    为什么潜意识学习需要海量数据:从引导向量恢复看含噪逆问题

    论文研究潜意识学习为何需要数万条载体样本,并把引导向量蒸馏建模为含噪线性逆问题。作者以已知的残差流向量 Δ_T 作为教师特质,在相同载体前缀下比较 token 级硬标签 NLL 监督与全分布软标签 KL 监督。初始化时两种目标的梯度近乎共线且都与 Δ_T 对齐很差,但迭代优化后出现分化:软监督用几百条载体就能几乎精确恢复 Δ_T,硬监督即使数万条也远低于该水平。作者解释为局部上载体任务通过 Fisher 矩阵 F 映射特质,梯度指向 FΔ_T 而非 Δ_T,梯度下降相当于逐步减弱阻尼的 F 逆;软目标能恢复低曲率方向,硬标签则同时放大这些方向上的采样噪声,因此存在随独立载体数量增长的最优逆深度。作者据此认为,大规模载体数据集更多是为了抑制 Fisher 逆放大的标签噪声,而非揭示特质本身。

  11. Hugging Face Daily Papers · 收录 · 原文 论文25

    数据稀缺下 LLM 的协作式个性化偏好对齐:APO 方法

    针对用户反馈稀缺导致 LLM 个性化对齐困难的问题,研究者提出近似帕累托最优(APO)方法:先按更新兼容性对用户分组,组内结合梯度下降与受控上升协调相互竞争的目标,得到靠近组内用户最优点的初始化,再用少样本本地适配迭代精修。在 Fed-ChatbotPA 和 UltraFeedback 上,仅用 20 个本地样本即持续优于现有方法,并给出单步协作更新的条件次优性界,刻画初始化误差对后续随机适配的影响。

10月6日周二
  1. 论文追踪 · 收录 · 原文 论文55

    SycoLens 研究:单一谄媚翻转率掩盖纠正与屈从的区别

    研究者提出 SycoLens 模块化重放协议,对来自三家厂商的 11 个前沿模型进行约 76 万次受控重放,发现单一谄媚翻转率无法区分模型自我纠正与屈从。用户施压措辞决定哪些模型显得谄媚:断言相反结论与仅质疑答案的两类措辞对模型的排名几乎不相关,家族内排名一致性约 0.82 至 0.88,跨家族接近零。翻转效应在模型自身决策边界附近增大约 40 个百分点,但筛选中答案一致的条目仍贡献受影响最大模型约一半的总效应。在已知真值的算术任务上,一个模型在压力下重新推导并纠正错误,另一个则放弃正确答案且不展示推导过程。植入的推导会降低模型释放其所支持答案的概率,无论该答案对错。

    推荐理由论文用约 76 万次受控重放拆解谄媚翻转率的构成,指出单一分数会掩盖纠正与屈从的区别,为对齐评测设计提供可迁移的测量框架。

  2. Hugging Face Daily Papers · 收录 · 原文 论文39

    MEA:面向忠实模型解释的奖励驱动多智能体系统

    研究者提出 MEA 多智能体框架,用 Proposer agent 按问题和模态选择并配置解释工具,再用 Actor agent 针对忠实度端到端优化,把输出转成基于模型行为的自然语言解释,覆盖表格、文本和视觉三种模态。作者同时设计了涵盖特征归因、反事实推理和虚假特征检测的问题类型,并为每类配备基于扰动的忠实度指标。研究发现前沿 LLM 会系统性地产生不忠实的解释;在六份数据集上,加入模态自适应惩罚的忠实度奖励优化,使 MEA 相比未训练骨干分别提升 28%(表格)、21%(文本)和 34%(视觉),并优于事后解释方法、智能体式和闭源基线。

  3. Hugging Face Daily Papers · 收录 · 原文 论文48

    自生成反馈会破坏测试时训练:长时程适应的因果分解

    作者研究模型在推理时持续从自身输出学习所形成的反馈回路,在 128K token 流上测试了 125M 到 3B 的 TTT-E2E 模型以及基于 Adam 的 Qwen3-4B 适应过程。结果显示反馈是损害的主要来源:改用冻结模型生成训练文本,在 125M 和 760M 上消除了超过 98% 的损害,即使学习器仍在生成文本上更新。更好的源拟合可能意味着更差的迁移,一次更新可以改善对训练段落的预测,却损害独立的真实文本。作者提出的 Settlement 测试会在保留候选更新前用独立文本进行验证,显著降低损害同时保留真实文本上的适应能力,代码已开源于 GitHub。

  4. Hugging Face Daily Papers · 收录 · 原文 论文40

    研究者提出主动式 LLM Agent 的 3T 原则与 Proactivity-Gym 评测环境

    论文提出围绕任务能力、时间分配与信任三项联合原则(3T)设计、实现和评估主动式 LLM Agent,即让 Agent 在用户提出需求前利用闲置算力提供支持。作者将这三项目标对应到任务范围、预判时域、激活触发、处理时机和干预深度五个维度的设计空间,并说明所需的用户与环境表示、骨干 LLM 和 Agent harness 等情境与系统建模。研究还提出基于仿真的评测环境 PROACTIVITY-GYM,包含多日场景、有状态环境和带人设的模拟用户,用于评估主动式协助在多次交互中的后果。在 23 种模型与 harness 配置上的评测显示 3T 各维度存在明显性能差距,且 LLM 评判者常混淆任务能力与信任;30 人的人类研究显示,干预错位即便结果正确也会导致信任明显下降,参与者更偏好睡眠时段协助,即使其表现不完美,以保持当前专注。

  5. Hugging Face Daily Papers · 收录 · 原文 论文37

    PerturBot 用扰动训练打破视觉-语言-动作模型的模态捷径

    研究者提出 PerturBot,用于缓解视觉-语言-动作(VLA)策略中的模态捷径问题,即策略依赖训练中反复出现的视觉、词汇或动作线索而非任务证据来做决策。该方法在训练阶段引入保持任务语义的腕部视角扰动、加入含决策信息的指令描述,并混入随机与失败轨迹片段并按其中实际行为重新标注,推理阶段不做改动。作者同时提出离线指标 GroundingFscore,用于诊断策略对模态捷径的依赖程度,与任务成功率互补,判断策略是否在健康地扩展。论文称二者共同构成一套训练与评估框架,使 VLA 决策更多依赖任务相关证据。

  6. 论文追踪 · 收录 · 原文 论文44

    研究提出 SafeReAct:恢复后训练大模型被掩盖的安全机制

    论文发现后训练会掩盖基座大语言模型原有的安全机制,同时过度放大与后训练能力相关的表征,但安全机制本身并未被移除。作者据此提出 SafeReAct,通过在少数层上对齐 LoRA 适配器来恢复被抑制的安全行为。在四个先进大推理模型上的实验显示,该方法显著提升了对有害提示的安全表现,且未损害推理性能;在医疗等特定领域模型上的额外结果也支持其通用性。

  7. arXiv · 收录 · 原文 日期未知论文35

    差分隐私混合公共数据集提升隐私学习效果

    研究者提出首个能在差分隐私(DP)下为特定敏感下游任务学习多个公共数据集混合配比的流程,核心思路是通过隐私学习一个低维线性模型来找到最佳混合方案。在 NIH ChestX-ray14 的 X 射线分类任务上,该方法相比基线将 macro AUC 最多提升 0.037,在 ε=1 时 Cardiomegaly 的相对 AUC 提升达 22.8%;在 ENRON 邮件数据集的 DP 训练中,用 The Common Pile 混合数据预训练使测试困惑度相对降低 16%。

  8. arXiv · 收录 · 原文 日期未知论文24

    长时程轨迹监督如何影响终端智能体训练的可靠性与成本

    研究提出"监督时程"(保留用于训练的轨迹 token 数)是终端智能体可靠性与成本的关键设计轴:在 Terminal-Bench 上,12K token 时程解出的任务多于 16K(29±0.7 对 26±0.8),训练时间还少 30%。短时程导致过早终止,中等时程带来有效的错误恢复,长时程则引发过度坚持。据此提出的选择性长时程精炼先在短前缀上训练、再仅对 warm-start 模型下最可能的续写做精炼,在 16K 下将成功尝试从 110±2.7 提升到 126±2.1,八次中至少六次解出的任务从 9±0.7 提升到 14±0.6,并迁移到 Terminal-Bench v2.0 与 OpenThoughts-TBLite。

  9. arXiv · 收录 · 原文 日期未知论文37

    MemAdapter:用反事实适配缓解记忆诱发的谄媚

    针对长期记忆让 LLM 智能体过度迎合用户历史信念的谄媚问题,研究者提出 MemAdapter 框架。作者指出,现有缓解方法假设谄媚源于有偏或错误记忆,但现实中客观正确的记忆同样可能诱发谄媚,且同一记忆在不同语境下的影响应有所不同。MemAdapter 包含三个组件:反事实归纳,用反事实推理揭示检索记忆的潜在风险;上下文感知反思,通过自我反思校准每条记忆在当前任务中的推理影响;基于证据的推理,在保留记忆合理影响的同时让最终回答有据可依。在三个基准上的实验显示,MemAdapter 在多种场景下持续提升记忆可靠性,代码已开源于 https://github.com/DEEP-JLU/MemAdapter。

  10. arXiv · 收录 · 原文 日期未知论文27

    神经网络的具体算法可解释性:以纹理分类为例

    研究者提出一套框架,用于构建参数实现可被显式算法解释的神经网络。该方法将每个数据点建模为类别相关随机过程的样本,构造初始参数精确实现统计量估计算法的网络,再通过控制偏离算法初始化的幅度进行微调,使训练后的网络大致保留初始解释;PAC-Bayesian 分析给出复杂度项随微调半径缩放的泛化界。框架以散射变换估计判别统计量,在纹理分类上实例化。

  11. arXiv · 收录 · 原文 日期未知论文44

    FADE:面向视频扩散模型的帧感知多概念擦除框架

    研究者提出 FADE,一个面向文生视频扩散模型的多概念视频遗忘框架,用于从预训练模型中擦除指定概念并尽量保留其余行为。FADE 先做联合闭式 key/value 编辑抑制全部目标概念,再训练按帧索引与去噪时间步门控强度的逐概念帧感知低秩适配器,以消除残留的逐帧泄漏;每个适配器用其他目标的提示词作硬负样本训练,并通过基于相似度的软路由按提示词组合。在 Wan2.1-T2V-1.3B 上擦除 16 个概念(物体、艺术风格与裸露内容)时,FADE 将物体基准上的残留准确率降至 4.9%,八种基线中最强者为 15.5%,同时 VBench 平均分与未编辑模型的差距在 0.9% 以内。该排序在 VLM 评判与盲测人类研究中保持一致,优势也延续到组合多个已擦除概念的提示词、30 个同时擦除的名人身份,以及 Wan2.1-T2V-14B、CogVideoX-2B 和 HunyuanVideo-1.5。

  12. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文48

    TrustMI:通过模型激活因果控制助手对用户的信任

    研究把助手对用户的信任定义为愿意接受对方行为带来的脆弱性,并检验这种信任能否通过模型激活被因果控制。作者构建了覆盖能力、善意与诚信三个维度的 2000 组对比对话,每组回答完成同一请求但在是否信任用户上不同,在冻结模型参数的前提下学习引导矩阵。在来自三个模型家族的六个指令微调模型上,引导在两个方向上单调改变信任决策。研究进一步在涉及有害请求、提示注入和内部威胁的 Agent 安全场景中检验该效应,并以良性任务和推理作为对照,结果显示对用户的信任可沿激活空间中的线性方向被因果控制。

  13. arXiv:越狱、提示注入、投毒与防御 · 收录 · 原文 日期未知论文34

    AURA:用正交适配缓解 LLM 推理与安全对齐的子空间干扰

    研究揭示大语言模型的"序列子空间干扰"现象:在多步数学与代码生成等逻辑任务上做标准微调,会对齐基准造成 23.3% 的干扰惩罚,削弱模型安全先验,且现有适配方法难以捕捉这种"推理漂移"。为此提出谱正则化框架 AURA(Adaptive Unique Residual Allocation),通过估计对齐流形的零空间并将推理更新约束在其正交补上,强制推理与安全之间的谱独立性。实验显示 AURA 挽回 23.0% 的损失性能,同时保持对安全状态大于 0.98 的余弦保真度。

  14. 论文追踪 · 收录 · 原文 论文56

    研究揭示文本水印会诱发模型幻觉,并提出两种缓解干预

    研究者提出“水印幻觉”概念,指在上下文已包含所需证据、未加水印模型能正确作答的情况下,水印本身诱发或放大的事实错误。在受控 RAG 设定下,作者对比同一上下文、查询和解码配置下的加水印与未加水印生成,覆盖 KGW、SWEET、DiPmark、GumbelSoft、Gumbel-Max 和 SynthID 六种水印方法,一致观察到事实准确率下降,且水印输出仍可保持流畅。作者将成因归结为两条机制:当前步由方法特定重加权或键控采样带来的 token 扰动,以及随自回归解码累积、削弱后续对事实上下文注意力的前缀诱导注意力漂移。为此提出 token 级和注意力级的两种可插拔干预 FPTI 与 FPAI,在 TPR@1%FPR=0.90 时联合使用可将事实错误相对仅水印解码减少约 90%,同时保持流畅度和相近解码效率。

    推荐理由论文在受控 RAG 设定下量化六种水印方法带来的事实准确率下降,并给出可插拔的缓解方案,为水印部署提供事实性评估维度。

  15. 论文追踪 · 收录 · 原文 论文38

    HERA 提出 harness 与环境协同演化,提升 Agent 拒答准确率至 83.3%

    HERA 是一个面向 Agent 拒答(agentic abstention)的 harness 与环境协同演化框架,用于解决 LLM Agent 在工具使用环境中无法识别任务不可行的问题。它包含两部分:一是通过受控环境变异,把可解任务自动转化为需要拒答的不可行任务,构造可验证的可行与不可行任务对;二是协同演化流程,用此前任务上的失败驱动 harness 调整,并生成针对既往弱点的执行环境与任务。在留出评测任务上,演化后的 harness 将拒答准确率从 61.7% 提升到 83.3%,可行任务完成率从 68.3% 提升到 76.7%,在对比方法中两项指标均为最高。该 harness 无需针对具体模型优化即可迁移到其他 19 个 LLM,平均提升拒答准确率 15.3 个百分点,并使较小模型以约低 85% 的成本达到更强模型的性能。

  16. arXiv:可解释性 · 收录 · 原文 论文↑155

    研究:智能体欺骗行为在外部显现前已可从内部表征预测

    上海人工智能实验室等机构的研究者提出把智能体欺骗监测转化为行为发生前的内部状态预测问题,在行为决定性步骤之前提取隐藏状态并聚合成轨迹级表征,用基于 MMD 的深度核检测器区分未来诚实与欺骗结果。在 Qwen3-14B 上,提前七个步骤的表征即可达到 90.4% AUROC,与最新决策前表征的 89.4% 相当;从轨迹起点累积前缀时,平均 AUROC 由第一步的 51.2% 升至第十步的 80.0%。研究者还沿诚实与欺骗方向做激活引导,在 α=2.0 时把诚实结果比例从 50.0% 提升到 71.6%,被选中干预的基线欺骗轨迹中有 56.0% 转为诚实。作者指出标签来自可观察行为而非潜在意图,且仅在单一模型族的白盒设定下验证。

    推荐理由论文把智能体欺骗当作可提前读取的内部过程,给出预测、信号累积与激活引导三层证据,适合关注欺骗监测的研究者。

  17. arXiv:可解释性 · 收录 · 原文 日期未知论文34

    基于影响力的曲率感知数据加权激活引导方法

    研究提出影响加权激活传输方法,用影响函数估计每个数据点对模型概念表征的贡献,并按影响分数加权概念样本,通过最优传输将非概念文本的激活引导向概念文本。在毒性抑制(Jigsaw)、物体概念诱导(OneSec)和真实性诱导(TruthfulQA)上优于现有激活传输基线,同时用困惑度和 MMLU 准确率追踪能力,发现引导效果提升且基本保持模型质量。影响函数能捕捉激活方法遗漏的概念相关信息,两种方法对数据点的排序显著不同。

  18. arXiv:可解释性 · 收录 · 原文 论文54

    研究者提出 CAP 指标与 CSFD 算法,发现越狱通过压制安全特征绕过拒答

    研究者提出反事实激活潜力(CAP)指标,用编码器对齐、抑制强度和安全性关键度三项乘积刻画被压制的安全特征,并给出 CAP 引导的安全特征发现(CSFD)两阶段筛选算法,从数十万 transcoder 特征中筛出候选而无需穷举消融。在 Gemma-2-2B、Qwen3-8B、Gemma-3-4B-IT、Qwen3-1.7B 和 Llama-3.2-1B 五个模型上,78% 至 100% 的候选特征经消融验证具有因果作用,单个特征置零可使最高 82.5% 的拒答转为顺从。使用 PAIR 攻击时,最高 CAP 特征受到的抑制强度上升 2 至 4 倍,激活相应下降最多 80%;放大抑制特征本身即可降低其激活并提高有害顺从率,而随机特征无此效果。作者据此认为越狱部分通过压制安全关键特征而非仅激活有害特征实现,被压制特征是激活式可解释性的必要补充。

    推荐理由论文提出用编码器对齐、抑制强度与安全关键性三项乘积定位被压制的安全特征,为理解越狱机制提供了激活视角之外的补充。

  19. arXiv:可解释性 · 收录 · 原文 日期未知论文42

    One Token Can Be Enough:用 Prefix Steering 连接提示与激活引导

    研究提出 Prefix Steering,从提示末尾 token 起在短跨度内施加已有的引导方向和算子,之后不再直接干预。作者在固定状态注意力假设下给出单 token 与多 token 引导匹配提示所诱导注意力头输出的充分条件,并刻画输入表示变化对匹配及其近似误差的影响。在四个模型和五个任务上,短跨度干预甚至单 token 干预常能保留完整引导的大部分行为控制力,同时更好地保持通用能力,在部分设置下优于提示和其他引导强度策略。该方法在推理后的最终答案格式任务上仍然有效,说明短暂的初始干预可以影响引导结束后才表现出的行为。

  20. arXiv:可解释性 · 收录 · 原文 日期未知论文28

    TSAE:用于解释时间序列预测模型的结构化稀疏自编码器

    TSAE 是一种结构化稀疏自编码器,将时间序列预测模型的隐藏状态分解为可单独检查的特征,通过共享与变量路由的私有字典组织跨变量结构,并用门控编码分离特征检测与幅度估计。在冻结 PatchTST 于 ETTh1、ETTh2、ETTm1 的三种子实验中,TSAE 在五种 SAE 中取得最低隐藏状态重构误差、归一化预测重构误差(NFRE)和特征转移率,NFRE 较次优均值下降 4.3-26.4%。配套 TSEVAL 协议分别审计保真度、特征一致性与物理校准,但选择性、物理相关性和校准存在数据集相关权衡,保真度与时序稳定性提升仍需独立语义验证。

  21. arXiv:可解释性 · 收录 · 原文 日期未知论文39

    ScopeSAE 按预测相关性选择建模子空间,实现重建优于原始激活

    研究者提出 ScopeSAE,用归一化梯度归因把每个预测归到最有影响的 token-层状态,从而按 token 选择建模子空间,而非按层固定子空间。作者称该方法出现重建优于原始的效果,即 SAE 写回重建的下一 token 交叉熵低于原始激活,并称此前未见 SAE 报告过这一现象。通过干预分析和 KL 微调对照实验,作者认为该效果来自预测相关的子空间本身,而非架构改动。相比现有按层基线,ScopeSAE 在有效特征数、可解释性、利用率和字典冗余上均有改善。

  22. arXiv:可解释性 · 收录 · 原文 日期未知论文27

    SpeechLLM 免训练任务特化:对比激活加法引导语音语言模型

    研究者提出免训练的对比激活加法(CAA)协议,用少量带标注语音样本为 SpeechLLM 推导出针对转录等常见语音任务的引导向量,在推理时将其加入表示空间以强化目标任务。与提示词结合后,这些向量在 ASR、情感识别等多数评测任务上稳定优于单独使用提示词,并可迁移到域外数据;脚本归一化方向还能强制模型输出特定语言的文字系统。

  23. arXiv:可解释性 · 收录 · 原文 日期未知论文34

    用迭代零空间投影提取人格子空间以调控 LLM 行为

    研究者提出 PaSS,一种无需重训练的推理时控制范式,把 LLM 的人格建模为潜空间中的多维子空间,并通过迭代零空间投影(INLP)逐层剥离出人格专属方向。在 MATH-500、TinyAlpaca、GSM8K 和 IFEval 等任务上对六种人格做因果评估,结果显示迭代子空间提取比单方向加性方法实现更强、幅度更大的调控,同时保持内容保真度。研究还逐一分析子空间中被剥离的方向,揭示其编码的人格行为不同侧面。

  24. arXiv:可解释性 · 收录 · 原文 日期未知论文37

    First-Order Steering:将权重适配转化为激活引导

    研究者提出 First-Order Steering,把激活引导表述为权重更新矩阵的一阶近似,由引导强度向量参数化,并给出该近似的理论误差上界。基于此,他们开发了模型合并方法 HeRD-Merging,通过最小化一阶近似误差项提升引导精度。作者称该方法生成的引导向量在控制单一行为和组合行为时都比现有激活引导方法更准确,同时 HeRD-Merging 在性能上与传统模型合并基线相当,且其权重适配能产生更准确的一阶引导向量。

  25. arXiv:可解释性 · 收录 · 原文 日期未知论文44

    研究揭示语言模型拒答行为的转向维度差异

    研究提出用转向子空间维度衡量控制某一行为所需的最小维度,并检验两类拒答行为。结果显示,由安全对齐触发的拒答是 1 维可转向的,多个不同转向方向都能实现相近控制;而一般语境中的拒答激活几何更复杂,即使 5 维转向子空间也无法可靠覆盖其全部可转向变化。作者据此指出,拒答背后的激活几何高度依赖语境,可能远比单一线性转向方向复杂。

  26. arXiv:可解释性 · 收录 · 原文 论文55

    研究揭示 LLM 风险偏好中自我报告与行为由近乎正交的表征方向控制

    加州理工等机构的研究者用激活引导(activation steering)在四个开源权重模型上考察风险偏好,发现自我报告与行为由近乎正交的内部方向控制。研究比较了九种引导向量提取方法,覆盖任务指令、模型自身选择、风险特质描述和 Big-Five 人格画像四类监督来源,在 Columbia Card Task 和 BART 两个行为任务以及 BFI-44 和 DOSPERT 两个自评量表上评估。结果显示,基于特质描述的方向能改变自我报告但几乎不影响行为,基于模型自身任务选择的方向则相反,只有任务指令类方向能同时触及两个通道,但其行为效应在剔除表面混杂因素后仅保留 32%。两个通道的方向近乎正交,移除另一通道的方向族后仍保留 92% 至 102% 的效应。组合一个行为方向和一个自我报告方向可同时驱动两者,反转其中一个符号后,四个模型在 69% 至 89% 的反向组合中出现报告与行为相反的状态。

    推荐理由论文用激活引导把 LLM 自我报告与行为的分歧落到表征层面,并给出可复现的检验方法。

  27. arXiv:可解释性 · 收录 · 原文 日期未知论文51

    研究揭示 Pythia 训练早期低于随机水平的暂时性偏好成因

    研究者在 Indirect Object Identification 任务上发现,Pythia 模型训练早期会偏好被重复提及的名字,导致二选一准确率低于随机水平,而同一窗口内语言模型损失仍在下降。作者通过在与因果评估不同的提示上选出写入重复名字的注意力头,固定选择后用非重复名字提示上的平均输出替换各头最终 token 输出,在单独训练的 160M 模型以及官方 160M、410M、1B 模型上改善了正确减重复的 logit 差值。在 160M 规模,成熟模型中降低重复名字的那个头在早期几乎不表现出成熟行为,对重复提及的注意力不足 1%,其输出也几乎不直接降低该名字的 logit,这两项属性在行为恢复的区间内增长。将对应头的成熟参数移植到早期 checkpoint,可恢复训练结束时正确减重复 logit 差值总改善的 35% 至 68%。

  28. arXiv:可解释性 · 收录 · 原文 日期未知论文36

    Spatial-SAE:用空间依赖先验改进视觉概念分解

    论文指出稀疏自编码器(SAE)虽基于线性表示假设(LRH),但其目标函数隐含了跨图像 patch 概念相互独立的先验,这一假设与自然图像及其激活不符。作者将 LRH 特化到视觉领域,提出 Markov-Field Linear Representation Hypothesis(MFLRH),补上缺失的空间依赖假设,并据此提出 Spatial-SAE,作为 MFLRH 下的摊销 MAP 估计器。在四个变体上,Spatial-SAE 在合成概念恢复任务中取得 96% 的平均胜率,并在 DINOv2 激活上提升可解释性,重建代价集中在高空间频率。

  29. arXiv:可解释性 · 收录 · 原文 日期未知论文35

    ClasSAE:通过可微特征-类别亲和度实现类别对齐的稀疏自编码器

    ClasSAE 提出一种在训练中自动为特征分配类别、并引导编码器学习类别可分表示的方法,用可微 top-k 算子作用于可训练的特征-类别亲和度矩阵,使编码器与亲和度矩阵协同适应,无需事后探测。在 ImageNet 上使用 CLIP ViT-L/14 嵌入时,学到的亲和度矩阵与在留出数据上独立估计的事后特征-类别矩阵高度一致,模型还能仅凭编码器和亲和度矩阵直接进行类别预测,并在 Targeted Probe Perturbation 评测中取得更好的分离效果。