跳到正文

对齐方法与失效:可扩展监督、奖励作弊、谄媚与价值观。

566条动态与论文相关主题欺骗与谋划可解释性奖励作弊
在这个话题内搜索或按分类筛选

新闻与论文

第 341–360 条 · 共 566 条
10月1日周四
  1. arXiv:可解释性 · 收录 · 原文 论文29

    量化 LLM 中的激活引导:剂量响应、能力成本与失败不对称性

    研究系统考察了仅权重量化(INT8 与 NF4)下激活引导的表现,覆盖四个 7-9B 开源模型和情感、推理长度两个行为目标。情感引导在量化后基本不受影响,INT8 合并对比为 -0.010(90% CI [-0.026, +0.007]),判定为等效;推理长度则呈不对称剂量响应,缩短仅 12-30% 后即出现不连续失败。Mistral-NF4 在 alpha=0 时 GSM8K 从 0.545 降至 0.365,显示压缩本身可主导引导效果,但引导向量与 FP16 版本仍高度共线(INT8 余弦相似度 0.989-0.998,NF4 为 0.945-0.990)。

  2. arXiv:可解释性 · 收录 · 原文 论文46

    研究:激活引导的干扰反映模型默认倾向而非行为方向

    论文发现激活引导(activation steering)的干扰由模型自身决定,而非被引导的行为方向。作者在 24 种行为和 10 个指令微调模型上得到三项结果,所有效果均由语言模型评判器从生成文本读出,而非探针。第一,一个不含行为内容、仅在与真实引导所加向量大小上匹配的方向,会以与真实引导相同的顺序移动相同的行为,却不产生任何需要特定方向的行为。第二,多数干扰是单向的,因此不能解释为两个方向的重叠:引导脏话会让模型变得有毒,而引导毒性不会影响脏话。第三,完全留出某一行为时,用其他行为测得的几何几乎无法解释它参与的干扰。

  3. arXiv:可解释性 · 收录 · 原文 论文39

    Steering Vector Dissection:将激活引导向量拆解为独立语义特征

    论文提出 Steering Vector Dissection 框架,用于把激活引导中纠缠多个语义与风格概念的复合方向拆解为各自独立的语义一致特征。方法上,作者配对正负激活并取差值生成实例级引导向量,再直接在这些向量上训练专用的 Sparse Autoencoder(SAE)。在 2 个数据集、2 个模型和 2 种干预深度上的定量评估显示,该方法得到的基向量语义一致,且引导效果彼此可区分,从而支持对模型行为更精确的控制。论文共 31 页、5 张图。

  4. arXiv:可解释性 · 收录 · 原文 论文27

    基于 SAE 引导的关键路径识别(KPI)解决知识冲突

    针对 SAE 引导中"大规模引导"因相关性不准和忽略特征交互而引入冗余特征的问题,研究者提出关键路径识别(KPI)方法,通过识别与上下游特征具有强因果依赖的关键引导特征并构建关键路径,以更少的特征修改完成引导。在存在知识冲突的 RAG 任务中,KPI 相比最佳大规模引导基线平均提升 18% 准确率,有效过滤冗余特征并缓解副作用。

  5. arXiv:可解释性 · 收录 · 原文 论文34

    Training-Free Task Vectors:无需微调的 LLM 行为控制方法

    研究者提出 Training-Free Task Vectors(TFTVs),无需微调即可计算类任务向量方向,仅用前向传播统计将激活引导向量映射为秩一权重空间编辑,并支持加法学习、减法遗忘与多编辑组合。在 LLM 行为控制任务上,TFTVs 能持续放大、抑制和组合目标行为,同时保留通用知识与解题能力,相比其他编辑与引导基线实现了更强的特质控制,效用保持相当或更优。代码已在项目网站公开。

  6. arXiv:可解释性 · 收录 · 原文 论文26

    GeoSteer:面向大语言模型激活引导的测地线优化方法

    GeoSteer 是一种基于优化的保范激活引导方法,把激活引导建模为黎曼优化问题,通过在表示流形上连续小步测地线更新激活来控制 LLM,并用学习到的非线性激活空间目标自适应引导每一步,避免固定引导方向。在 TruthfulQA、RealToxicityPrompts 和 UltraFeedback 基准上,GeoSteer 一致优于当前最先进的激活引导基线。结果表明,用自适应、几何感知的优化替代预定义的单步编辑,可让保范引导更有效。

  7. arXiv:可解释性 · 收录 · 原文 论文20

    超越求解器判定:面向自动形式化的生成式奖励模型

    研究提出 Verdict-Preserving-Unfaithfulness(VPU)失效模式:错误的形式化翻译仍能通过求解器并得到预期判定,并证明仅依据判定的结构性验证启发式检测能力在数学上被限制在随机水平。为此提出 Generative Verification(GenV),将离线 Z3 等价性 oracle 蒸馏为无参考的连续参考等价性评分,机制分析显示其可原生提取精确的空间错误坐标。oracle 挖掘的验证器 GenV+HN 在参考等价性验证上达到 0.961 AUROC,零样本泛化到未见翻译器与不同形式风格,并在智能体测试时算力分配上带来 11.3 个百分点的下游准确率提升。

  8. arXiv:可解释性 · 收录 · 原文 论文20

    Llama-3.1 医学微调模型在专业术语理解上为何不如通用版:一项机制可解释性对比分析

    研究构建两个医学术语评测基准,对比通用版 Llama-3.1 与医学数据微调变体,发现通用模型在两项任务上均优于医学微调模型。机制可解释性分析显示,微调模型未重组参数知识,而是过度依赖少数与术语偏好预测相关的组件,造成系统性校准偏差;对这些组件重新加权可抑制其影响并追平通用基线。部分术语敏感组件还能迁移至材料科学术语任务,提示其编码了部分领域无关的专业术语概念。

  9. arXiv:可解释性 · 收录 · 原文 论文25

    语言模型激活空间中的可操控性特征

    研究证明,简单的分离度指标与语言模型的下游可操控性在不同设置下均强相关,即便控制层数和数据集效应后依然成立。基于合成叠加实验,分离度指标与经验特征方向和真实特征方向之间的一致性也高度相关。结果表明,这类可分离性统计量可作为判断 steering vector 何时有效的实用诊断工具。

  10. arXiv:可解释性 · 收录 · 原文 论文43

    Fixed-SAE Track:从机制可解释性看 LLM 从强化学习中学到了什么

    研究者提出 Fixed-SAE Track 框架,在每个考察层上基于基座模型与全部 RL checkpoint 的激活训练一个共享 SAE,固定特征方向以严格定义表征漂移。在多个数据集和 RL 算法上验证发现,RL 引起的漂移幅度小、渐进、与概念相关且集中在后层,主要提升一小批 ladder token 及步骤分隔、答案定界符等格式脚手架特征的采样率,而非重塑问题内容。把这些特征引导进基座模型可恢复约 80% 的 RL 性能增益,说明 RL 主要是激发模型已有能力。作者还设计了一个特征已知的合成基准,用于检验 RL 能否真正引入全新特征。

  11. arXiv:可解释性 · 收录 · 原文 论文18

    在 Llama 3.1 8B-Instruct 等 LLM 内部定位并因果操控"机会识别旋钮"

    研究团队在 Llama 3.1 8B-Instruct 中定位出一个"机会识别方向",并通过对该内部表征的因果干预实现"机会识别旋钮"的上下调节,模型的创业机会判断随之改变。研究构建了 636 对匹配的"有机会/无机会"情景对,经留出测试、词汇与主题控制、行为消融和几何比较验证该方向可恢复、有因果作用且区别于机会评估与开发方向。该方向的恢复、有符号操控与几何分离在另外四个不同规模与家族的 LLM 上同样成立。

  12. arXiv:可解释性 · 收录 · 原文 论文25

    共情可被激活引导但呈多轴结构:LLM 中的机制几何与人格效应

    基于 EPITOME 框架(将支持性共情分解为情绪反应、解释与探索三个维度),研究者在三个指令微调 LLM 上发现,对比激活添加能在中间层产生稳定干预并一致改变 EPITOME 代理分数,但恢复出的方向仅部分可分,引导一个方向会引发非目标偏移。人格提示词会显著改变 EPITOME 分数,而配对激活偏移分解显示,恢复的子空间在第 15 层仅捕获约 3% 的人格诱导激活偏移平方幅度。在该定义下,LLM 表达的共情可被引导但呈多轴结构,控制人格条件下的共情需要针对超出单个机制方向的结构。

  13. arXiv:可解释性 · 收录 · 原文 论文43

    研究揭示细粒度危害信号在 LLM 安全中的作用

    研究通过从各风险类别的危害表征中移除共享的通用危害表征,得到与通用危害性在每一层都正交的类别残差,并用激活引导在 3 个指令微调 LLM 的 11 个风险类别上测试。结果显示,类别残差是否编码危害性因类别而异,且这一类别模式在不同模型间相似;类别残差是否引发拒答同样因类别而异,但这一模式更依赖具体模型。研究还发现类别残差会增强 LLM 下游内部与共享通用危害表征的对齐。作者据此认为,理解 LLM 安全不能只看共享的通用危害表征,还需考虑更细粒度的类别残差;即使某一层上与某概念正交的方向,也可能促进该概念在下游的放大。

  14. arXiv:可解释性 · 收录 · 原文 论文29

    当 AI 评审训练 AI 评审:科学判断坍缩与 TrustReviewer 缓解方案

    研究以 Llama 3.1 8B 为基础,先用 ICLR 2018–2023 官方评审微调出评审模型,再用 ICLR 2024 数据、按不同比例混合官方与模型生成评审训练四个后继模型,发现引入合成评审会压缩评分分布并降低同论文与语料级语义多样性,作者称之为“科学判断坍缩”。为此提出开源系统 TrustReviewer,训练阶段在精选语料上单阶段训练核心评审模型以减少低质量与语义退化监督,测试阶段用配对激活引导(activation steering)在不再训练、不额外专家标注的情况下抑制残余的坍缩判断倾向。

  15. arXiv:可解释性 · 收录 · 原文 论文42

    同一结果,不同读出:LLM 中可引导效价方向究竟代表什么

    论文把 LLM 内部方向代表什么的问题当作构念效度问题,在迷宫任务中研究一个好坏结果方向,并用受控干预把实际结果与获知该结果的信息历史分开。在多个 LLM checkpoint 上,用一种显式结果编码拟合的方向能较好迁移到另一种编码,说明读出并不绑定表面形式。但当同一实际结果分别经由已预告和未预告的历史达成时,迁移显著下降:即使两种历史随后都收到相同的显式结果,事件后的读出仍强烈依赖此前的预告。在基座模型中,沿该方向做引导会改变动作,但移除该方向后自然线索效应几乎不变。在匹配的迷宫 RL 训练中,RL 后的方向对参考 MDP 剩余回报的预测性明显增强,策略在测试位置也更依赖它,而历史依赖依然存在。

  16. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文8

    Uni-TMPO:统一轨迹匹配策略优化,提升 T2I 生成多样性与 VLA 泛化

    Uni-TMPO 是一个面向扩散与流策略的统一 RL 后训练框架,用前向 KL 优化让策略分布匹配由标准化奖励构造的目标分布,替代传统的奖励最大化。该方法在 T2I 上取得更高奖励,并获得最佳的奖励—多样性—效率权衡;在 VLA 上取得更高的 ID 成功率,并更好地泛化到留出任务与场景。真机评测显示,当更高奖励目标受阻时,多种动作策略具有实际价值。

  17. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文50

    RLVR 中的验证器错误:奖励作弊、反馈局限与选择性控制

    论文研究可验证奖励强化学习(RLVR)中验证器不完美会奖励错误回答、从而引发奖励作弊的问题。作者用固定验证器的梯度流刻画了奖励上升而正确率下降的条件,并指出 RLVR 过程中可观测到的信息通常不足以检测或识别被接受的错误,也无法在不牺牲正确回答的前提下保证减少这些错误。为此作者利用来自审计的正确性额外反馈构造修正项,实现选择性控制:在当前策略下降低被接受错误的概率、提高正确回答的概率,前提是该修正强于验证器奖励带来的错误压力。在 log linear 与神经上下文赌博机以及一个语言模型上的实验支持了该分析,并显示部分审计下的选择性控制能减少被接受的错误同时提升正确率。

  18. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文35

    CoRe:协同演化奖励模型缓解视频扩散模型中的潜在奖励作弊

    针对固定潜在奖励模型优化会导致潜在奖励作弊、生成视频的感知与运动质量下降的问题,研究者提出协同演化奖励框架 CoRe,将潜在空间对齐视为生成器与奖励模型之间的动态交互,持续用生成器当前样本重新拟合奖励模型并锚定真实视频偏好,使生成器无法通过偏离数据分布获取高奖励。在 Wan2.1-T2V-1.3B 上,CoRe 的生成质量持续优于预训练模型和既有对齐方法,并避免了固定奖励优化带来的质量崩溃。

  19. arXiv:对齐、欺骗与监督 · 收录 · 原文 论文28

    SURE:构建可信 AI 的安全框架

    研究提出 SURE(A Safe and Unified AI Framework foR Everyone)框架,用于按国家、文化和企业政策定制 AI 安全属性并加以保障。该框架建立对抗性提示词分类体系并据此构造提示词,定义理想 AI 回复模板与绝对安全评分方案,再通过数据集进行 AI 对齐。在多种基座模型上的实验验证了 SURE 的有效性,论文已被 KDD 2025 EAI Workshop 接收。

  20. Hugging Face Daily Papers · 收录 · 原文 论文18

    为测试时 AI4AI 的智能体执行环境设计学习元技能

    研究提出 Meta-Skill 元技能,让 Builder 在模型权重冻结的前提下,从 Target 在开发集上的执行反馈中学习"何时需要支持、提供什么资源"的原则,再用冻结的技能库为未见任务构建执行环境。在 Harness-Bench 和 NewtonBench 上,完整技能库的元技能比无技能构建提升宏平均性能 8.95 个百分点,比直接把同一技能库交给 Target 高 12.02 个百分点。同一模型同时担任两种角色时仍有增益,提示可通过学习构建更好环境实现系统级自我改进。