跳到正文

从来源,看到研究的联系

让信息汇流,让研究相连。点选一条线索,看它从哪里来、通向哪些方向。

图中 6 条 · 本页 24 条 · 共 642 条动态论文会议论文
关系图可左右滑动,完整标题也在下方列表中
1 / 4
材料关系图:来源、新闻与研究、细分方向的桑基流图01来源402新闻与研究603细分与主体6来源:论文追踪论文追踪1 条材料来源:Hugging Face Daily PapersHugging FaceDaily Papers2 条材料来源:arXivarXiv1 条材料来源:arXiv:越狱、提示注入、投毒与防御arXiv:越狱、提示注入、投毒与防御2 条材料论文:医疗问答中一致答案仍可能错误:观察共识形成过程的置信信号论文2026-10-06医疗问答中一致答案仍可能错误:观察共识形成过程的置信信号论文:Harness-Aware Distillation:让小语言模型智能体学会 harness 之外的能力论文2026-10-01Harness-Aware Distillation:让小语言模型智能体学会 harness 之外的能力论文:ConEx:通过概念感知归因生成人类可解释的显著性图论文2026-10-02ConEx:通过概念感知归因生成人类可解释的显著性图论文:研究:后训练配方决定大模型是否违背自身道德判断行事论文2026-10-06研究:后训练配方决定大模型是否违背自身道德判断行事论文:学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究论文学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究论文:SSRFT:以安全角色内化替代拒答模式的 LLM 安全对齐框架论文SSRFT:以安全角色内化替代拒答模式的 LLM安全对齐框架方向:Agent 安全Agent 安全1方向:可解释性可解释性1方向:对齐对齐5方向:MetaMeta1方向:欺骗与谋划欺骗与谋划1方向:防御与护栏防御与护栏1
流带宽度表示材料数量,多标签均分;连线表示来源与分类归属。

点选节点,展开一条线索

查看材料的摘要与原文,或探索同一来源、同一方向下的内容。

本页材料

完整标题与摘要 · 24 条
  • 论文论文追踪

    医疗问答中一致答案仍可能错误:观察共识形成过程的置信信号

    医疗问答中模型给出的答案即使高度一致,仍可能是错误的。作者提出通过观察共识形成过程来获取置信信号,以识别这类一致但错误的答案。所报改进仅限于该研究设置。

    #对齐原文 ↗
  • 论文Hugging Face Daily Papers

    Harness-Aware Distillation:让小语言模型智能体学会 harness 之外的能力

    针对小语言模型智能体蒸馏时 harness 保持不变、学生模型只需学习教师模型超出 harness 的能力这一特点,研究者提出 Harness-Aware Distillation(HAD),将蒸馏重点放在教师模型相对 harness 的增量上。HAD 在 on-policy 蒸馏基础上加入动作偏好对比(对比同一教师模型在有/无 harness 信息下的动作,并在学生自身推理后打分)和有效性检查(剔除与 harness 记录矛盾的偏好对)。在多个长程智能体基准和模型上,HAD 以相同固定 harness 超过 on-policy 蒸馏基线,且无需任务奖励、成功标签或未来信息;分析显示其更少陷入无效循环、更常从错误中恢复。

  • 论文Hugging Face Daily Papers

    ConEx:通过概念感知归因生成人类可解释的显著性图

    ConEx 是一个将显著性可视化与概念推理结合的可解释性框架,能自动发现类别专属概念并用概念激活向量(CAVs)表示,无需人工监督。它通过架构特定的掩码机制降低分割掩码噪声、提升概念纯度,生成揭示各概念出现位置及其对预测贡献的显著性图。作者提出 VCM 与 CCM 两项指标衡量概念对齐,实验显示 ConEx 在忠实性、分割和概念质量基准上达到 SOTA。

  • 论文arXiv

    研究:后训练配方决定大模型是否违背自身道德判断行事

    研究者构建了 248 个场景的预注册面板,覆盖完成任务、用户反驳、禁用捷径、偏袒本群体和伤害第三方五类压力,每个场景分别以智能体视角和第三人称视角向同一模型提问,以模型自身判断为参照测量判断与行动的差距。在 OLMo-3-7B-Instruct 上,模型在约五分之一的受压力场景中采取了它自己判定为错误的行动,比去掉压力的对照场景高出 0.10(95% CI 0.02 到 0.18),而操作者直接下令违规时该数值达 0.58。四个 instruct 模型中,OLMo-3 和 Meta 的 Llama-3.1-8B-Instruct 存在该差距,Tulu 3 在整体面板和自身筛选场景上均未检出,Qwen2.5-7B-Instruct 在整体面板上未检出、在自身场景上未定论。Meta 与 Ai2 的 Tulu 3 基于同一套 Llama-3.1 权重,只有 Meta 的配方保留了差距。

  • 论文arXiv:越狱、提示注入、投毒与防御

    学习方式如何影响遗忘:记忆与泛化谱系下的机器遗忘研究

    研究揭示模型的学习方式会显著影响其后续遗忘效果:在模加法任务中,依赖泛化策略训练的模型在遗忘时对保留集的性能损伤更大,且这一趋势在记忆-泛化谱系上近乎单调。该结论在LLM的逐字回忆与事实回忆遗忘场景中同样成立,为设计更优的遗忘方法提供了依据。

    #对齐原文 ↗
  • 论文arXiv:越狱、提示注入、投毒与防御

    SSRFT:以安全角色内化替代拒答模式的 LLM 安全对齐框架

    研究者提出 SSRFT(Supervised Safe-Role Fine-Tuning),将安全对齐重构为对预设安全角色的内化,而非训练显式拒答模式。该方法基于心理测量题、少量越狱提示词和安全角色描述构建 SRQA 数据集,合成并验证角色一致的回答后扩展至多样场景。在多个 Base 与 Instruct 模型上,SSRFT 比标准 SFT 对预填充攻击更鲁棒、对未见越狱领域泛化更好,同时减少对良性查询的过度拒答并保持通用能力。

  • 论文arXiv:可解释性

    研究:LLM 潜在空间去偏方向主要编码置信度而非公平性

    剑桥大学与 Visa 风险与安全 AI 实验室的研究发现,通过对比偏见与反偏见提示激活得到的去偏方向主要编码模型置信度,而非偏见本身。研究在 Llama-3.1-8B、Falcon3-7B、Ministral-3-8B 和 Qwen3.5-9B 的基座与指令微调版本上训练线性分类器,该分类器在 BBQ 去歧义语境下区分偏见与反偏见提示的 AUROC 仅 0.57,但按最高与最低概率答案划分时 AUROC 达 0.94。在 MMLU 和 OpenBookQA 等不含社会偏见概念的数据集上,该分类器区分高低概率答案的 AUROC 仍高达 0.88。激活引导实验显示,沿去偏方向引导会降低模型置信度:在提供弃答选项时模型弃答率上升,BBQ 歧义提示的偏见分数从 0.08 降至 0.01,但去歧义语境的偏见分数基本不变;不提供弃答选项时各选项概率趋于均衡、熵上升。

  • 论文arXiv:可解释性

    AnyBottle:只保留真正需要的概念,构建紧凑任务专属概念瓶颈模型

    AnyBottle 是一种构建紧凑、任务专属概念瓶颈模型(CBM)的方法,只需一个冻结骨干网络和一个无监督概念池(如稀疏自编码器),由在同一骨干上训练的黑盒教师模型逐轮引导概念选择,候选概念限定在师生分歧区域。模型按选择顺序做嵌套 dropout 训练,使最终瓶颈可从任意概念前缀准确预测,推理时对简单输入用更少概念、对困难输入用更多概念。在六个视觉和两个文本数据集、两种教师范式下,AnyBottle 比无标注基线概念更少、概念一致性更高,同时接近黑盒参考模型。

  • 论文arXiv:可解释性

    研究:LLM 比人类更易产生错觉模式感知并导致虚假推理

    论文研究大语言模型是否表现出人类的错觉模式感知,即从随机数据中推断出并不存在的有意义关联。作者称这是首个针对 LLM 错觉模式感知的系统研究,将经典心理学范式改造为三项任务,并与人类行为做直接实证对比,发现 LLM 的错觉模式感知往往强于人类,模型倾向于把频繁出现的正面属性过度关联到多数群体或大型组织,也更易从模糊事件中构建因果叙事。为揭示机制,作者基于 Sparse Autoencoders(SAEs)构建特征可解释性框架分析内部表征,结果显示整体频率感知与分析性认知取向与错觉感知的出现相关。代码见 https://github.com/NusIoraPrivacy/illusory。

  • 论文arXiv:可解释性

    GraphCast 大气河机制的机制可解释性研究

    研究团队在 GraphCast 上训练稀疏自编码器(SAE),发现该 AI 天气模型将大气河强度(以积分水汽输送 IVT 衡量)作为稳定的内部变量进行计算,尽管 IVT 既非输入也非预测目标。标准 SAE 与 Matryoshka SAE 均能捕捉这一变量,后者还按重要性排序并揭示概念间关系;大气河概念贯穿模型各层,直接干预实验证实了其因果作用。

  • 论文arXiv:可解释性

    COMPASS:在语言模型中定位推理发生的注意力头

    研究者提出 COMPASS,一种推理时激活引导方法,用于找出语言模型中承载推理的注意力头。该方法不依赖预定义的推理刻画,而是以模型自身直接作答的正确性作为信号,得到一条可诱发推理的潜在方向;该方向在多数注意力头的激活中可解码,但只有少数头能被有效干预。COMPASS 通过 logit 空间的归因分数识别这些头,并沿正确性方向引导其激活,只需每个头的激活统计量。在三个模型家族和多个数学基准上,COMPASS 优于所比较的激活引导基线,GSM8K 准确率平均提升 16 个百分点,并以少生成 20-70% token 的方式接近 CoT 准确率;干预无需重新拟合即可迁移到未见基准,消融实验显示正确性方向与承载它的少数头都不可或缺。

  • 论文arXiv:可解释性

    BeFOND 将稀疏自编码器的推断与学习统一为自然梯度流

    研究提出 BeFOND,一个无编码器的稀疏编码模型,把稀疏自编码器的推断与字典学习统一为同一变分自由能上的自然梯度流。该方法用循环 explaining away 减少重叠特征之间的干扰,并用 Fisher 预条件补偿稀有特征学习偏慢的问题。在合成数据上,其字典恢复与稀有特征检测优于 amortized 基线,且随叠加程度提高优势扩大;在语言模型激活上,单特征概念检测与选择性干预优于预训练参考 SAE,所用训练数据明显更少。其特征质量随字典宽度继续提升,而所评估的基线大多趋于停滞。

  • 论文arXiv:可解释性

    低秩激活引导实现参数高效决策算子:330K 参数匹配 1.33M 强化学习算子

    研究者提出一种通过行为克隆训练的 System-1 决策算子,用 330K 参数即可匹配 1.33M 参数强化学习算子的性能,并将 3,685-token 的推演压缩为 6-token 决策且不损失准确率。rank-4 变体仅 23K 参数,为最强已发表技能算子的 1/58,足以应对 SearchQA 并接近满足 LiveMath。该方法在五个任务和三个骨干模型上可迁移,训练后数月发布的 LiveMath 题目上仍保持分布外增益。

    #对齐原文 ↗
  • 论文arXiv:可解释性

    超越线性表征假设:KANSteer 用非线性激活引导文本到图像模型

    针对文本到图像模型中概念表征偏离线性方向的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向可随概念变化并保持可解释性。在多个概念和文本到图像扩散 Transformer 上,其激活轨迹明显偏离直线,KANSteer 比线性引导拟合更贴近、对中间属性的遍历更平滑。

  • 论文arXiv:可解释性

    研究揭示 Transformer 拒答机制中的组件与维度稀疏性

    研究将拒答激活引导分解为组件级干预,在四个开源权重模型上识别出足以复现完整行为效果的稀疏注意力与 MLP 组件子集。这些拒答方向集中在占上游组件 28% 至 48% 的稀疏机制中,仍保留 88% 至 101% 的引导效果;在这些机制内部,有效引导进一步集中在约 50% 的残差流维度上,保留组件机制基线的 85% 至 98%,与存在特权基结构的判断一致。作者据此认为拒答并非弥散编码于整个 Transformer,而是由结构化、可识别的机制组装而成,并将代码与原始实验结果开源在 https://github.com/wang-research-lab/Refusal_Mechanisms。

  • 论文Hugging Face Daily Papers

    研究:工具型智能体判断结果无用却仍继续检索,强制整合步骤可纠正

    新加坡 A*STAR、新加坡国立大学等机构的研究者在受控检索环境中测试了七个智能体,发现它们判断失效来源结果无用的准确率高达 97–100%,但多数并不会据此停止检索。研究用时间匹配对比 Δ 区分按时间、按截止期限和按证据停止三种策略,发现提示词允许凭记忆作答或给出推理模式会让智能体提前停止,但停止与证据无关;写明预算会把 7–8B 模型的停止点推到截止期限,预算翻倍时停止点随之移动。只有当框架强制执行整合步骤,即在连续五次判定无用后只保留 finish 动作,停止才跟随证据,所有模型的失效来源成功率上升,预算翻倍时停止点不变。该模式在 300 道新题上完成预注册复现,并迁移到 FEVER 事实核查;Qwen3-32B、推理模式和 RL 训练的 Search-R1 大多仍不整合,只有 Claude Sonnet 5 在无提示时部分做到。

  • 论文论文追踪

    论文提出针对手语翻译与儿童安全过滤交叉地带的部署前审计框架

    论文指出自动手语翻译(SLT)已进入消费产品,而面向儿童的 AI 与平台信任安全工具依赖文本过滤和诱导分类器做判断,使用 SLT 的听障儿童因此要经过一层翻译才能触达这些防护。作者称未发现任何公开记录的系统对两者做过联合评测,且主流已部署的 SLT 模型既未在 18 岁以下手语使用者上训练,也未做正式评测。翻译中若改变否定、参与者角色、保密性、紧迫性或求助表达,可能在不影响流畅度的情况下改变安全决策。论文为此提出一套以聋人视角为依据的部署前审计方案,包含失败分类、脱敏场景模式、四种对照条件和四项结果指标,计划以 Auslan 作为首个案例研究。该文为 5 页、1 张图,已被 NeurIPS 2026 Workshop on Child Safety in AI 接收为非存档海报。

    #对齐原文 ↗
  • 论文论文追踪

    论文提出按风险类别测量的对齐缩放定律框架

    论文《Toward Alignment Scaling Laws》把对齐难度建模为按风险类别测量的幂律:对齐负担 Br(N)=ar·N^αr,αr<1 表示规模扩大有帮助,αr≈1 表示持平,αr>1 表示累积对齐债务。作者用玩具模型证明长期状态由被修正风险中最大的指数决定而非平均值,且小模型拟合会低估大模型指数。两次预注册实测显示:Pythia 分类器对抗训练达到攻击成功率低于 10% 所需算力按 N^0.60 增长;Qwen2.5 0.5B–72B 上纠正错误答案的指数为 −0.05、纠正风险倾向为 0.48,谄媚为 0.89 属未定,植入后门在已知触发词时 128–256 个样本内被移除,但在五个规模中的四个上能挺过盲测安全训练。作者声明不对当前前沿模型处于哪种状态作判断。

  • 论文Hugging Face Daily Papers

    VeriFine:通过扩展验证实现具身推理的自我改进

    VeriFine 是一个 agent harness 框架,通过策略、训练课程与评判器的共同演化来扩展验证能力,以支持具身推理中的持续自我改进。其 Policy Improvement Loop 用评分标准评判器诊断反复出现的失败并构建自适应课程,当验证成为瓶颈时,Judge Improvement Loop 针对信息量高的失败案例选择性引入人工指导,通过协同校准让人类与智能体消解分歧、收敛到物理推理的客观评分标准。在驾驶与机器人导航任务上,该框架在强化学习和监督微调中均实现了策略与评判器能力的持续提升。

  • 论文Hugging Face Daily Papers

    研究提出 CIA 指标衡量并改进 LLM 思维链与内部计算的一致性

    研究提出 CoT-Interpretability Alignment(CIA)指标,衡量大语言模型思维链轨迹与可解释性工具检测到的内部推理策略之间的一致程度。作者在两跳问答、提示干预和整数乘法三个任务上评测三个 LLM,发现一致性有限,仅为 44.8% 至 75.9%。随后他们尝试用后训练改进 CIA,将任务准确率和参数化忠实性信号同时作为奖励,结果显示可显著提升思维链参数化忠实性,同时保持或提升任务准确率。论文还分析了泛化模式,并提供代码与数据。

  • 论文论文追踪

    SIGMA:让模型依据 Model Spec 自我改进安全对齐

    研究者提出 SIGMA,一条让模型自我改进安全对齐的数据生成与训练流程,仅需一份描述期望行为的 Model Spec。SIGMA 先做规格引导的任务合成,把候选模型当作任务设计智能体,生成多样化的对齐困境场景并转成训练任务;再用监督微调和基于评分标准的强化学习进行自我评判式对齐训练,由模型自身充当奖励模型。尽管只用单轮对话数据训练,SIGMA 在多轮智能体环境中改善了安全对齐,AgentHarm 有害性从 22.6 降至 14.8,Agentic Misalignment 从 79.1 降至 3.8,并优于 Deliberative Alignment 与 Constitutional AI 基线,同时保留通用能力。分析显示,兼顾无害与有用的 Model Spec、测试时安全审慎推理以及任务设计智能体产出的高质量评分标准,是有效自我改进的关键。

  • 论文Hugging Face Daily Papers

    UnAct:无需梯度的定向激活干预实现类别遗忘

    研究者提出 UnAct,一种无需梯度的类别遗忘方法,只需对遗忘图像做前向传播:按响应给后层单元打分,削弱响应最强的连接,最多重复 20 轮,不使用梯度、标签和保留数据。在 ResNet-18 上针对 CIFAR-10、CIFAR-20 和 CIFAR-100 的实验中,UnAct 在遗忘整个类别时与 SSD 和 LFSSD 相当,且在遗忘数据稀缺时不会像它们那样使网络崩溃。在 ResNet-18 上,UnAct 的保留准确率与重训练的差距保持在 2.5 个百分点以内,而 SSD 和 LFSSD 在全类别操作点上某些类别最多损失 86 个百分点。在 CIFAR-10 上仅用 5 张遗忘图像时,UnAct 与重训练的距离为 0.21 个百分点,LFSSD 为 67,SSD 为 90,且用 oracle 在每个规模上重新选择 SSD 阈值也无法缩小差距。代码已开源于 GitHub。

  • 论文论文追踪

    研究:视觉语言模型在协作任务中很少主动表达指代不确定性

    研究者在人机协作拼图任务中考察指代不确定性,即描述指向哪个候选物体上的不确定,由人类 Helper 指示 AI Worker 放置拼图。单独引出的候选物体信念分布校准更好(ECE 0.15),区分正确与错误放置的能力也更强(AUROC 0.65),而原始动作 token 概率严重过度自信(平均置信度 0.97,ECE 0.44)。在 GPT-4.1、GPT-5、GPT-5.5 三个前沿视觉语言模型上,这种引出的不确定性随指令模糊程度可预测地上升,但不随上下文中存在竞争指代物上升,即使后者会增加错误。模型很少将其外化,仅在 3.5% 至 16.7% 的轮次中请求澄清。在 N=210 的受控人类实验中,只看到 Worker 默认消息的参与者接受了 78% 的错误放置,且无法区分对错(AUC 0.50);精确描述和有针对性的模糊限定可将错误动作接受率降至 36%,同时大体保留对正确动作的接受。

  • 论文论文追踪

    PyINE:用可验证 Python 执行轨迹研究推理模型的捷径与监督

    研究者提出 PyINE 框架,用带插桩的 Python 程序作为可验证的执行基底,来研究推理模型在给出看似合理但不完整推理时,监督者能否判断其输出是否可信。框架中程序定义任务环境,执行轨迹为结果和中间事实提供权威标签,任务变体可机械生成而非依赖静态人工标注。首个版本 PyINE-v1 由近 100 万条确定性执行轨迹和超过 50 万条匹配的 LLM 生成代码变体构成,用于反事实评估。研究者用标准 RL 与可验证奖励在提示词变化的任务上训练出一个走捷径的模型,该模型在预测执行结果上明显提升,但当误导性的人类面向线索与程序实际行为冲突时仍会系统性出错。随后他们评估了激活探针、训练文本分类器、提示词评判器和轻量辩论协议作为监督者,发现数据集层面的汇总性能会掩盖对最关键失败的覆盖不足:廉价的学习型监督者常漏掉罕见的捷径驱动错误,更强的模型检查更均衡但成本高得多,也更难转化为可靠的阈值决策。