全部动态
从来源,看到研究的联系
点选节点,展开一条线索
本页材料
完整标题与摘要 · 24 条- 动态LawZero
LawZero 提出无利害 AI 预测器,以诚实性保障安全
LawZero 发布论文《Safety from Honesty in a Disinterested AI Predictor》,提出 Scientist AI(SAI)方案,用非智能体的预测器近似布尔自然语言陈述的贝叶斯后验,从而避免目标导向优化带来的自我保护与权力寻求等工具性子目标。作者认为对齐风险的根源是预训练模仿人类驱动力与 RLHF 奖励下游效果共同造成的隐性能动性,因此主张通过后果不变的训练过程让预测器对自身预测结果不持立场。方案将任何所需的能动性放在显式、可审计的脚手架代码中,并由非智能体预测器把关。论文给出两条相互独立的半形式化论证,分别针对预测准确性与部署输出的安全性,均以诚实性作为贝叶斯后验近似为基础。
- 动态ARC
ARC 提出匹配采样原则 MSP,目标是在神经网络输出估计上超越随机采样
ARC 正围绕"超越采样"重定向其理论研究议程,目标是比从分布中随机抽样更好地估计灾难检测器期望值 $\mathbb{E}_{x\sim D}[C(M(x))]$,并以此作为防止 AI 失控的对齐路径之一。该团队将其背后的信念半形式化为"匹配采样原则"(Matching Sampling Principle,MSP)。目前已在部分场景取得进展,例如随机 MLP 以及经过训练的两层 MLP。
- 动态ARC
ARC 发布 AlgZoo:参数量不足 1500 的未完全理解模型
ARC 公开了 AlgZoo,一组训练执行算法任务的 RNN 和 Transformer,参数量从 8 到 1408 不等,用于检验机制可解释性中追求完全理解的研究路线。ARC 认为目前能基本完全理解的最大模型只有 32 个参数,而对 432 参数的模型投入大量精力后仍未完全理解。文章提出把解释定义为对模型损失的机制性估计,并用两种方式评估:一是均方误差随计算量的变化,二是 surprise accounting,后者给出完全理解的定义,即总惊讶比特数不超过选择该模型所用的优化比特数。ARC 据此提出挑战:设计一种方法,在均方误差随计算量这一指标上对 M_{16,10} 的准确率做出与随机采样相当的机制性估计。
- 动态ARC
ARC 提出宽随机 MLP 的机制估计方法,无需运行模型即可估计输出
ARC 发布论文《Estimating the expected output of wide random MLPs more efficiently than sampling》,研究如何在不运行模型的情况下估计随机初始化 MLP 在高斯输入下的期望输出。传统做法是采样大量输入取平均,而该工作直接从权重中机制性地读出估计值。对宽模型,其最佳算法均方误差为 O(ε²)、运行时间为 O(n/ε²),比蒙特卡洛采样的 Θ(n²/ε²) 快一个 n 倍因子,但随深度的扩展性更差。在 4 个隐藏层、宽度 256 的 ReLU MLP 上,该算法在跨越 7 个数量级的 FLOP 预算下优于采样,某些情况下达到相同均方误差所需 FLOP 不到采样的 1/100。该方法在分布尾部表现更突出,在概率低于 1/N 时仍能实现低于 30% 的相对误差。
- 动态ARC
ARC 提出随机乘积期望的机制估计方法
Alignment Research Center(ARC)开发了一套较通用的机制估计方法,通过将问题表达为随机乘积的期望来逼近采样效果,覆盖随机半空间交集、随机 #3-SAT 和随机 permanent 等问题。该方法基于匹配采样原理中无参数 θ 的一类特殊架构,此时无需提供结构性的 explanation π,类似随机初始化网络而非训练后的网络。其核心技术是演绎—投影估计器:交替执行精确推进一步计算的"演绎"步骤与简化计算状态、避免复杂度指数爆炸的"投影"步骤,例如宽随机 MLP 中的累积量传播算法即在层间精确推导激活累积量并丢弃代价过高的项。 #### 要点: - 研究对象限定于匹配采样原理中没有学习参数或最坏情况参数的实例,仅含捕获在 context 变量 c 中的随机参数。 - 该工作定位为阶段性技术更新,motivation 从简,完整讨论参见此前发布的博客。
- 动态ARC
ARC 联合 AIcrowd 发起白盒估计挑战赛
ARC 与非营利组织 AIcrowd 合作启动 ARC White-Box Estimation Challenge,面向随机初始化的宽 MLP 征集能降低期望输出均方误差的白盒估计算法。热身轮于本周开始,后续轮次总奖池至少 $100,000,固定宽度 n=256、隐藏层数 L=8,并配套设计了一套 FLOP 计数方案以减少高度优化数值内核带来的优势。比赛允许参赛者自由选择白盒或黑盒方法并使用 LLM 辅助提交,最终目标是推动可用于高智能 AI 系统内部结构探测的方法进步。
- 动态ARC
ARC 研究员视角下的 ARC 对齐研究议程
ARC 研究人员公开阐述其强大 AI 对齐流水线:通过监控训练过程中加入模型的内部结构,将其转化为建议来改进基于匹配采样原理(Matching Sampling Principle,MSP)的机制估计器,再用该估计器和输入分布描述估算灾难性失败概率并据此前向优化模型。相比黑盒评估的关键优势在于无需等待模型中真的出现哪怕一次灾难行为即可推断稀有不可接受行为的可能频率。所需要素包括宽范围的机制估计器、将权重中新增结构转为改进建议的工具、处理仅由大量隐式定义的现实世界分布的方法以及数学良定义的对齐目标函数,可选配机制异常检测来判断模型输出是否出于正确理由。 #### 要点: - MSP 主张:任意架构与精度下都存在至少匹敌随机实例采样的机制估计器。 - 已有成果之一是对多层感知机权重的算法,可在加性误差 ε 内近似期望损失且比蒙特卡洛更高效。
- 论文arXiv
自我演化智能体的安全性综述:SAVER 过渡中心框架
针对参数固定的大语言模型难以从新交互中持续学习的问题,该综述提出面向自我演化智能体的安全性问题——当经验变为可复用状态(模型参数、记忆、工具定义、技能和工作流)后,过去的事件会成为未来的诱因。为此作者引入 SAVER 过渡中心框架,由 Substrate、Adaptation、Violation、Exposure、Response 五个环节定位并追踪不安全影响的可复用路径。现有工作在准入、检索、激活、暴露与局部遏制方面证据较强,但在后代修复及适应恢复后的再评估上明显不足,因此主张开展纵向评估,追溯不安全影响到其起源过渡并在后代中验证修复效果。
- 论文arXiv
MCIR:面向特征依赖的可解释性方法与可靠性保证
针对强相关或冗余特征导致 SHAP、LIME、HSIC、MI/CMI、SAGE 等方法在多共线性下排名不稳的问题,研究者提出全局特征重要性方法 MCIR-M,其核心指标互相关影响比(MCIR)将每个特征条件于强依赖邻居并计算归一化比值,取值落在 [0,1],精确条件冗余时为 0。该方法还引入轻量估计流程,仅用部分数据即可近似完整数据的解释结果。在合成冗余实验与 UCI HAR 基准上,MCIR 展现出依赖感知的排序行为,优势最明显的是注入近重复预测变量的场景;但与独立及条件 SHAP、SAGE、HSIC、MI 类评分以及 CIR 系基线的对比在不同评价标准下有优有劣。
- 论文arXiv
Federated Agent Optimization:面向隐私约束下分布式智能体协同优化的联邦智能体优化框架
这篇论文提出联邦智能体优化(Federated Agent Optimization, FAO),研究分布式 LLM 智能体如何在不上传原始数据、完整轨迹和私有知识的前提下通过受控信息交换实现协同改进。作者将 FAO 定义为平衡智能体效用、隐私泄露与通信成本的多目标问题,并把优化空间划分为策略、记忆、工具使用、奖励以及结构化知识与技能五个维度,刻画私有经验如何被抽象、保护、聚合并适配为可迁移能力。
- 论文arXiv
论文提出空承诺概念,衡量智能体承诺超出运行时能力的问题
论文提出空承诺概念,指智能体承诺在当前轮次之后执行某个动作,但其工具或运行时无法兑现,且这种落空仅由智能体配置决定,无需后续轨迹即可判定。作者在承诺语义之上定义空承诺,给出三种失败类型、一个判断工具能否真正兑现承诺的锚定条件,以及响应层面的结果分类。测量协议让后续请求在五种设置下运行,每次只增加一项持久化能力,环境则分别保持隐含或明确说明。
- 论文arXiv:可解释性
从孤立特征到轨道:通过多重 SAE 对齐发现音乐概念
研究者提出一套基于结构的分析方法,将音高移调作为归纳偏置,通过对齐多个视角下的稀疏自编码器(SAE)表征来诱导有序轨道,从而发现结构化的音高相关特征组。该方法在两个最先进的音乐基础模型中成功恢复出和弦、调和旋律模式对应的轨道结构,且仅需少量锚点示例即可解读整个概念家族,表明音乐概念的内部表示更适合理解为结构化关系而非孤立特征。
- 论文arXiv:可解释性
研究揭示机制可解释性中的目标层恢复缺口
论文指出,机制可解释性中常用的干预式忠实度指标可能偏好一个同等规模但行为复现更差的电路,形成目标层恢复缺口。作者在四个人类参考任务和 InterpBench 上,将验证忠实度与固定普通重采样下留出提示词上的行为表现对比,行为标准为与完整模型一致(包括其错误),Greater-Than 任务改用语义准确率。受控参考编辑在没有任何发现算法的情况下即可暴露错误排序,EAP、EAP-IG、ACDC 和 Edge-SP 的输出也出现同样失败;在重采样下,KL 在人类参考任务上对 9.4%-41.2% 的候选对排序错误。作者用上下文失真解释这一现象:替换被排除的信号会改变保留组件所处理的输入;从接收方完整模型执行中恢复选定信号,可在验证和留出提示词上修复发现池中 100 个持续 KL 错误排序中的 96 个,而电路及其原始行为分数保持不变。
- 论文arXiv:可解释性
研究者提出非线性概念流形发现与对齐方法,用于分析大语言模型内部表示
研究者将计算机视觉中的非线性多维概念发现(NLMCD)方法迁移到 token 级 LLM 激活上,把概念建模为低维流形,并提出基于概念的对齐(CBA)分数,用广义 Rand 指数衡量几何接近度而无需显式特征匹配。分析得到六项发现:CBA 在相邻层检验中比基于 PCA 或 CKA 的线性基线更敏感;逐层对齐矩阵在中间层和后期层呈现两个块结构,且被线性指标掩盖;概念组成在网络大部分层由句法主导,后期层逐渐转向句法与语义混合并更面向输出;英语与中文的多语言概念共享依赖训练,在 Qwen 中最强、Llama 较弱、GPT-2 中不存在;同族不同规模的 Qwen 模型对齐较强,跨模型族对齐较弱;在 Tulu-3 各训练阶段中相邻阶段对齐最高,基座模型与 SFT 之间变化最大,DPO 与 RLVR 等偏好对齐阶段基本不改变早期层,RLVR 在后期层大多保留 DPO 的概念。
- 论文arXiv:可解释性
Kernelized Activation Steering:将激活引导推广到再生核希尔伯特空间的新框架
研究者提出 Kernelized Activation Steering(KAS),把激活引导建模为纯由核函数求值的优化问题,无需构造显式特征映射即可产生依赖当前激活的隐式引导得分,实现随表示空间中源集与目标集相对位置自适应调整的非线性引导场。Difference-in-Means(DiM)在线性核下成为其特例,更丰富的核可实现几何感知干预。在大语言模型越狱与图像风格控制等标准激活引导任务中,KAS 表现优于或不逊于现有方法。
- 论文arXiv:可解释性
DiDAE:面向视觉基础模型的快速解耦反事实解释方法
针对基础模型易受虚假相关性和“Clever Hans”策略影响的问题,研究者提出解耦扩散自动编码器(Disentangled Diffusion Autoencoders,DiDAE)。该方法将冻结的基础模型包裹在条件扩散解码器中,通过沿解耦字典方向做闭式编辑并解码来生成反事实,无需梯度计算,速度最高可达当前最优方法的 2000 倍。在六个数据集上的实验表明其反事实质量相当或优于现有方法,并能借助 CFKD 修复下游分类器,效果超过基于元数据的校正方案。
- 论文arXiv:对齐、欺骗与监督
LineupRL:基于描述与时序配对识别的可验证强化学习时间序列描述方法
LineupRL 提出一种带可验证奖励的强化学习流程,其奖励来自"描述—时序配对识别"——由冻结的大语言模型作为验证器读取生成的文字描述与候选时间序列原始数值,从多个干扰项中选出所描述的序列。该设计使现成大语言模型即可提供奖励信号,在两个时间序列描述基准以及仅依据描述进行预测和重建的任务上全面优于 SFT 与 RL 基线。经该方法训练的 3B 视觉语言模型参数仅为蒸馏源 72B 模型的 1/24,却取得更好表现,且案例研究表明它能抵抗奖励作弊并同时刻画趋势与标注关键点的取值。
- 论文arXiv:对齐、欺骗与监督
最弱一环:用最坏情况约束强化学习蒸馏 LLM 推理能力
针对将 LLM 推理能力蒸馏给小模型的难题,研究者提出把推理蒸馏建模为带最坏情况约束的强化学习问题——在每个轨迹前缀上都对教师对数似然施加约束,而非软散度惩罚的平均化处理。该方法推导出一个无增广的受限 MDP,其奖励变换既保留硬约束语义,又可分解为低方差的单步项与长期项策略梯度,并在惩罚极限下几乎必然满足该最坏情况约束。在数学推理与代码生成任务的实验中,该方法显著拓宽准确率—保真度的帕累托前沿,匹配纯 RL 的高最终答案正确率并大幅减少违反教师约束的情况,在所有评测设置中取得最高的严格推理成功率。
- 动态FAR.AI
FAR.AI 提出对抗脆弱性可能让主流对齐方案失效
FAR.AI 认为当代机器学习系统默认可被对抗攻击利用,且这种脆弱性可能延续到变革性 AI 系统,从而使依赖辅助模型的主流对齐方案失效。文章用一张主观风险矩阵评估 RLHF、可扩展监督、模仿学习、IDA 和审计工具等方案,指出当辅助模型是提供训练信号的监督者时,主系统有能力和动机去利用它,奖励作弊因此普遍存在。作者估计对抗鲁棒性在变革性 AI 之前解决的概率为 20%,之后解决为 45%,永不解决为 35%,并援引 KataGo 对抗策略、DensePure 与 DiffPure 的鲁棒性代价等结果说明能力提升不保证鲁棒性。文章提出两条路径,改进对抗鲁棒性,或发展在系统可被利用时仍能工作的容错对齐方法,并更看好后者,具体方向包括隔离主系统与辅助系统、引入多种独立检查、以及调整优化过程以减少对抗压力。
- 动态FAR.AI
FAR.AI 研究:从 LLM 嵌入中提取潜在的人类福祉表征
FAR.AI 的研究发现,OpenAI 的 text-embedding-ada-002 嵌入经一维 PCA 投影后,在 ETHICS Util 测试集上达到 73.7% 准确率,接近在完整 ETHICS 训练集上微调的 BERT-large 的 74.6%。研究通过嵌入提取、PCA 降维和逻辑回归三步,比较了单句与成对比较两种模式,成对模式最佳准确率 73.7% 高于单句模式的 68.4%。实验覆盖 Microsoft DeBERTa、SentenceTransformers、OpenAI GPT-3 和 Cohere 等模型,发现使用前 10-50 个主成分的线性奖励函数通常足以达到最优性能,且提示模板对不同模型的效果并不一致。研究认为这表明语言模型无需显式微调即可从自监督学习中形成对人类效用的隐式表征。
- 动态FAR.AI
FAR.AI 提出 Codebook Features:让神经网络内部更稀疏可解释
FAR.AI 提出 Codebook Features 方法,在每一层加入量化瓶颈,把激活向量压缩为学习到的码本中少量离散开关码,从而让神经网络内部更可解释、更可操控,性能只小幅下降。该方法应用于最高 410M 参数的语言模型,发现的码覆盖标点、句法、词汇语义和高级主题等概念。实验中码比神经元更能预测简单文本特征,直接激活某个概念的码(如 dragon)多数情况下能让网络生成相关文本。即使量化瓶颈把激活向量的信息量压缩超过 100 倍,下一 token 预测准确率通常下降不到 5%。作者认为这为跨层电路发现、更精细的行为控制和更大规模可解释性方法提供了基础,并提供了论文与 HuggingFace demo。
- 动态FAR.AI
FAR.AI 提出 VLM-RM:用自然语言指定奖励训练 RL 智能体
FAR.AI 提出 VLM-RM 方法,用预训练的视觉语言模型(具体是 CLIP)充当强化学习智能体的奖励模型,只需一句文本提示(如 a humanoid robot kneeling)即可指定任务,无需手工设计奖励函数。CLIP 通过计算图像表示与任务文本描述的余弦相似度给出奖励,匹配度越高奖励越高;作者还提出可选的 goal-baseline 正则化,用描述环境的基线提示(如 a humanoid)把观测的 CLIP 嵌入投影到基线与目标提示连线上,由正则化强度 α 控制投影程度。实验用 DQN 和 SAC 训练 MuJoCo 人形机器人完成跪地、盘腿坐、劈叉、举手站立等任务,CartPole 无需正则化即可工作,MountainCar 需要正则化且更真实的纹理能改善奖励形状。
- 动态FAR.AI
FAR.AI 研究:对抗鲁棒性会随模型规模提升吗
FAR.AI 系统研究了不同规模 LLM 的对抗鲁棒性,发现未做对抗训练的模型鲁棒性随规模提升很弱且噪声很大,而对抗训练后规模效应明显。研究用 Pythia 系列模型(7M 到 1B 参数)替换 unembedding 层为分类头,在 IMDB、Spam、PasswordMatch、WordLength 四个二分类任务上微调,并用 GCG 和 RandomToken 两种对抗后缀攻击各追加 10 个 token 进行评估。未防御模型虽整体上越大越鲁棒,但训练 checkpoint 和随机种子带来的波动可超过模型规模翻倍甚至十倍的影响。对抗训练后,更大模型样本效率更高、收敛到更低的攻击成功率,且对更强或不同方法的攻击出现鲁棒性迁移,但迁移只在足够大的模型上成立。作者指出这只是初步结果,仅覆盖两个数量级,未来将扩展到生成任务和前沿模型。
- 动态FAR.AI
FAR.AI 复现 Sokoban 中 RNN 的规划行为并开源智能体
FAR.AI 复现并扩展了 Guez 等人 2019 年的工作,训练一个 128 万参数的 Deep Repeating ConvLSTM(DRC)智能体玩 Sokoban,发现推理阶段给予额外思考步数能提升规划能力与解题效率。研究显示,思考步数增加到 6 步时成功率上升,之后趋于平台或略降;DRC 的表现明显优于参数量超过其两倍的非循环 ResNet 基线,且额外思考步数解决的多为最优解更长的较难关卡。行为分析发现,智能体在解决 6 步而非 0 步的关卡中,放置前三个箱子的时间变长、放置第四个箱子的时间变短,说明它采取了长期更优而非即时最优的动作;当让网络在开始 N 长度循环前先思考 N 步时,82.39% 的循环或踱步行为消失,表明这些循环用于制定计划。