研究提出 AI Agent 种群生态理论:协作带来起飞临界规模
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
- arXiv
- 2610.12436
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险失准与价值偏离
摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
用依据置换与隐层追踪审计法律思维链是否真正依赖所引法条
本研究针对法律领域大语言模型思维链推理中引用法律依据的因果真实性展开实证审计。
提出研究世界模型,用语言模型预测干预增益
作者把语言模型用作研究世界模型,在执行前预测干预增益的中位数,用来在有限预算下比较候选实验。要处理的缺口是研究智能体提案快于执行。同一类改动在不同参考模型、配方和预算下效果可以不同,因此需要能离开原环境继续使用的实验知识。
用恐惧激活转向检验视觉语言模型的隐患判定准则
提出 RouterInterp,用 SAE 解释 MoE 路由的叠加特化
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
演化可检查评分器并与自改进 Agent 共同演化,抑制奖励作弊
开放任务没有验证器时,被演化的是评分器,而不是再补一条手写 rubric。
提出包络采样,用少量真值标注重标定 LLM 评委以缓解奖励作弊
作者研究后训练前如何选择真值标注的查询分布,使重标定后的廉价代理更适合被优化。真奖励昂贵时,实践用 LLM judge 代替人类。若失准只发生在基座很少生成的输出上,on-policy 标注修不到这些点,随后的 KL 正则优化会把质量集中到被高估的输出。
提出 DFI 与 DFC 蒸馏,定罪隐瞒失配的教师或安全提取能力
摘要概括了论文针对隐瞒失配模型提出的 DFI 与 DFC 机制、主实验发现及适用边界。
提出路由 TopK SAE,把语音编码器稀疏码拆成语言与副语言通路
TopK SAE 的稀疏码被分成语言通路与副语言通路,用来分开冻结语音编码器里同时存在的音素信息和说话人、情感、韵律。只重构不能得到作者选定的这一分解。语言通路由音素识别监督,副语言通路由说话人识别、情感分类和韵律预测监督,作用在对方通路上的梯度反转对抗用来压低交叉因子。
检验推理 token 数能否区分被提示的诚实与不诚实作答
三个推理模型在被提示的回答政策下出现组水平推理 token 差异。作者把它当作不读思维链内容的 black-box 候选信号,而不是自发欺骗检测器。
检验潜意识学习能否经无关数据蒸馏传递能力、后门与作弊
摘要作者报告潜意识学习可传递新技能、后门与作弊倾向,且分布外泛化强于单层转向向量。
证明限时且部分可观测环境下完美智能体不能保证安全
作者讨论的是:必须在有限额外观测后行动的控制器,在只能部分观测的环境里,能否有与模型无关的安全保证。要处理的情况是,延误本身有代价,而观测又可能分不清必须采取互斥安全动作的两个潜状态。分拣中心的透明药瓶是作者给出的例子。
提出模型生物多目标验证与合并训练方法以减少能力损伤
本论文提出了一种针对 AI 安全评测用模型生物(Model Organisms)的多目标训练与验证体系。
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
比较连续后训练阶段如何改变语言模型的说服力
作者用同一人类协议,把 LLM 说服力拆成阴谋数据上的失调 SFT、说服数据上的 SFT,以及其后的 IPO。
提出 System Switch,让快决策模型仅在门控打开时询问推理模型
System Switch在不暂停的 Doom 里,让快的 typed-decision 模型做每一次决策,只在门控打开时把控制交给视觉推理模型。
揭示推理模型用标识符规则替代随机抽样,使审计可被预测
摘要研究揭示推理智能体将标识符转化为确定性规则,破坏群体独立性并导致审计预测漏洞,建议显式提供随机输入。
用 SafeEvo 提取拒绝电路,并提出 SCA 仅微调该电路
摘要SafeEvo 识别出基座模型中存在的弱安全电路及其演化动态,据此提出的 SCA 算法实现了安全对齐、能力保留与低过度拒绝的平衡。
提出 SOUL 稀疏特征策略遗忘,缓解 VLA 状态幻觉
SOUL用稀疏特征引导的策略 unlearning 处理 VLA 的 state hallucination。