研究系统评测不确定性估计方法与 LLM 幻觉的关联
研究团队对 LLM 中不确定性估计方法与幻觉之间的关联做了系统性实证研究,不再预设二者相关,而是直接检验这种关联在何时、何种程度上成立。
- arXiv
- 2605.27016
- 发表
研究团队对 LLM 中不确定性估计方法与幻觉之间的关联做了系统性实证研究,不再预设二者相关,而是直接检验这种关联在何时、何种程度上成立。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出安全电路对齐,把对齐更新限制在预训练拒绝电路内
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
研究针对 Vision-Language-Action(VLA)模型中的状态幻觉问题提出 SOUL(Sparse feature pOlicy UnLearning)方法,即模型持续按尚未实现的机器人-物体状态行动这一反复出现的失败模式。
研究者提出 U-Space,一个低维子空间,用来让语言模型在推理过程中变化的不确定性变得可测量且可解释。
研究者在全开源全双工语音语言模型 Moshi 上测试了四种情感(happy、angry、surprise、sad)的激活引导,采用均值差激活引导,每帧仅需少量向量加法且无需重训练。
一篇 arXiv 论文对扩散模型潜空间水印方法的鲁棒性提出理论分析,指出既有方法高估了自身对旋转、缩放、平移等几何变换的抵抗能力。
ConEx 是一个将显著性可视化与概念推理结合的可解释性框架,能自动发现类别专属概念并用概念激活向量(CAVs)表示,无需人工监督。
分析激活引导去偏方向,发现其编码的是置信度而非公平性
摘要论文揭示激活引导去偏见方向主要编码模型置信度而非公平性,偏见评分下降实为诱发弃答或使概率均分的假象。
AnyBottle 是一种构建紧凑、任务专属概念瓶颈模型(CBM)的方法,只需一个冻结骨干网络和一个无监督概念池(如稀疏自编码器),由在同一骨干上训练的黑盒教师模型逐轮引导概念选择,候选概念限定在师生分歧区域。
论文研究大语言模型是否表现出人类的错觉模式感知,即从随机数据中推断出并不存在的有意义关联。
研究团队在 GraphCast 上训练稀疏自编码器(SAE),发现该 AI 天气模型将大气河强度(以积分水汽输送 IVT 衡量)作为稳定的内部变量进行计算,尽管 IVT 既非输入也非预测目标。
研究者提出 COMPASS,一种推理时激活引导方法,用于找出语言模型中承载推理的注意力头。
研究提出 BeFOND,一个无编码器的稀疏编码模型,把稀疏自编码器的推断与字典学习统一为同一变分自由能上的自然梯度流。
针对文本到图像模型中概念表征偏离线性方向的问题,研究者提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)将概念遍历建模为穿过中间状态的曲线,使引导方向可随概念变化并保持可解释性。
研究将拒答激活引导分解为组件级干预,在四个开源权重模型上识别出足以复现完整行为效果的稀疏注意力与 MLP 组件子集。
研究者提出 MEA 多智能体框架,用 Proposer agent 按问题和模态选择并配置解释工具,再用 Actor agent 针对忠实度端到端优化,把输出转成基于模型行为的自然语言解释,覆盖表格、文本和视觉三种模态。
提出操作有效性契约,审计激活监控从探针分数到告警策略的有效性
这篇论文系统评估了大模型智能体激活监控器从离线探针得分向在线警报策略跨越时的统计与操作有效性。
研究把助手对用户的信任定义为愿意接受对方行为带来的脆弱性,并检验这种信任能否通过模型激活被因果控制。