Federated Agent Optimization:面向隐私约束下分布式智能体协同优化的联邦智能体优化框架
Federated Agent Optimization
论文提出 Federated Agent Optimization,把跨机构智能体协作形式化为效用、隐私与通信的多目标优化,并给出组件分类与经验迁移框架。
- 企业 LLM 智能体的经验分散在各机构,受隐私与专有约束不能直接共享轨迹和本地知识。传统联邦学习主要聚合参数,覆盖不了策略、记忆、工具、奖励和结构化知识。
- 作者把 Federated Agent Optimization 定义为水平场景下的多目标问题,在类型化更新上平衡效用、泄漏和通信,并按组件分类现有方法,再用抽象、保护、聚合与本地适配把私有经验变成可迁移能力。
- 本文没有自己的实验。作者汇总文献称更新体积大约相差三个数量级:适配器约 76 MB,工具知识约 0.08–20 MB,技能补丁约 0.1–0.3 MB;并称尚无方法跨组件权衡三个目标。
- 作者把挑战放在性能–隐私–通信耦合、公平分配和可验证增益上,后续方向包括可执行性、恶意更新、公平、评测协议和全生命周期成本。文中数字来自对已有方法的汇总,没有 FAO 实测。
- 指标
- Uk(本地效用)Pk(泄漏,DP 或攻击优势)Ccomm(通信代价)CGk(协作增益)
这篇论文提出联邦智能体优化(Federated Agent Optimization, FAO),研究分布式 LLM 智能体如何在不上传原始数据、完整轨迹和私有知识的前提下通过受控信息交换实现协同改进。作者将 FAO 定义为平衡智能体效用、隐私泄露与通信成本的多目标问题,并把优化空间划分为策略、记忆、工具使用、奖励以及结构化知识与技能五个维度,刻画私有经验如何被抽象、保护、聚合并适配为可迁移能力。
深度解读
这篇论文试图解决什么问题?
跨私有环境的智能体如何在不共享原始数据与完整轨迹的前提下协作改进。
分布式私有环境中的 LLM 智能体如何在不交出原始数据、完整轨迹和本地私有知识的情况下,通过受控信息交换共同改进。
- 场景与重要性:作者称企业智能体已用于客服、软件开发、数据分析、知识管理、办公自动化、金融服务、医疗辅助和业务流程。持续执行会产生工作流、轨迹、工具使用记录和成败反馈,这些经验可以改进规划、工具使用和决策。经验又与用户数据、内部知识、业务规则、专有工具和流程耦合,难以直接共享,可复用经验因而留在本地。
- 现有方法的不足:联邦学习让客户端在原始数据留在本地的前提下交换并聚合模型更新。作者认为智能体能力还取决于决策策略、记忆、工具使用、环境反馈以及本地知识与业务规则,只聚合参数不足以做跨智能体协作。现有联邦学习范式尚未系统处理如何把一个智能体的经验、技能和反馈变成可共享能力,也缺少覆盖更广能力的统一优化框架。
- 核心观察:不同智能体常面对相似或相关任务,成功经验、失败模式和工具策略可以互补。有效联邦应让每个参与者获得协作增益,而不只提高总体表现。更丰富的更新可以提高效用,但往往以泄漏和通信为代价。
- 本文提出什么:作者提出 Federated Agent Optimization(FAO)。它把问题写成同时考虑本地效用、隐私泄漏和通信成本的多目标优化,按策略、记忆、工具使用、奖励、结构化知识与技能组织优化空间,并刻画私有经验如何经抽象、保护、聚合和本地适配变成可迁移能力。在此之上指出关键挑战和后续方向。本文是框架与分类,没有报告新的实证实验。
有哪些相关研究?
相关工作分联邦大模型、多智能体学习与隐私保护三类,作者称它们都未覆盖完整智能体能力。
联邦学习与联邦大模型
- 联邦学习 [196, 103, 226]——多个客户端在原始数据留在本地的前提下协作训练。早期工作主要处理异构数据下的模型聚合 [145],后续涉及通信效率 [33]、个性化 [173]、鲁棒性 [76, 107] 和隐私保护 [195, 106]。
- 联邦大模型适配——基础模型出现后,联邦学习扩展到大规模适配 [93],采用联邦微调 [193, 198]、LoRA [171, 14]、prompt tuning [239, 27] 和知识蒸馏 [162] 以降低计算与通信。作者认为这些方法仍以参数或表示为主要优化对象,联邦一个大模型不等于联邦一个智能体。
多智能体系统与智能体强化学习
- 多智能体系统 [69, 221, 98]——研究共享或交互环境中的协调、通信、分工和联合决策。基于 LLM 的系统进一步做角色分工、讨论、协商和相互反馈 [69, 210, 34]。
- 智能体学习——用执行轨迹 [176]、环境反馈 [219]、强化学习 [245, 227]、自我反思 [17] 和教师智能体 [215] 持续改进能力。作者认为这些方法大多假设智能体可以直接交换消息、轨迹或反馈,很少考虑跨组织的隐私约束和数据隔离,这与 FAO 要求本地数据、执行经验和私有知识保持分散不同。
隐私保护 AI
- 常见技术——差分隐私 [6]、安全聚合 [118]、同态加密 [87]、安全多方计算 [161] 和访问控制 [83],已用于分布式学习、云端推理和跨组织协作,保护训练数据、模型更新和中间表示。作者认为它们主要针对数据、参数或推理过程;智能体里敏感信息还可能嵌在轨迹、记忆、工具交互、业务规则和技能表示中,需要针对协作优化的新保护机制。
基线方法与基准
论文没有把自己的方法放到一组基线上做实验。第 3.4 节把若干范式写成式 (10) 的特例:联邦平均(更新为参数差,按样本量加权)[122]、不做隐私目标的经验池化 [201, 100, 228, 174]、单智能体优化 [88, 222],以及只联邦一个组件且隐私和通信由设计固定的方法 [35, 212, 200, 209]。第 6.3 节提到的评测起点包括通用智能体、网页与桌面交互、工具–用户工作流基准 [114, 244, 205, 213],以及刻画模型与系统异构的 FedScale [95]。
作者将 FAO 定位为:在数据与私有知识保持分散的前提下,把优化对象从模型参数扩到策略、记忆、工具、奖励和结构化知识,并同时处理效用、泄漏和通信。
论文如何解决这个问题?
FAO 用类型化更新和三目标协议,把本地经验经抽象、保护、聚合与适配变成可迁移能力。
整体思路是把 Federated Agent Optimization(FAO) 写成水平场景下 K 个客户端的协议设计问题:客户端上传按组件分块的更新,协调者聚合成视图,客户端再在本地数据上适配。优化同时追求效用、降低泄漏和控制通信。
问题设定与形式化
- 客户端与数据:K 个客户端的任务都来自同一任务空间 X。客户端 k 有任务分布 Qk、效用 uk,以及 nk 条任务及其轨迹组成的私有数据集 Dk。Qk 与 uk 可以不同,同质时重合。Dk 中的原始记录不得离开客户端。
- 智能体五元组:Ak = (πk, Mk, Tk, Rk, Ok)。πk 把上下文映射到动作,参数 θk 可以是连续的权重或适配器,也可以是离散的提示词或工作流图。Mk 存可供检索的经验,Tk 是可调用工具及其描述,Rk 是本地评估器,Ok 是显式陈述的本体、业务与环境规则和技能,不靠相似度检索。
- 轨迹效用:任务 x 上轨迹 τ 有 H 步,每步含上下文 sh、动作 ah、观察 oh 和反馈 rh,反馈常只在最后一步给出。效用 Uk(A; Qk) 是 uk(τ) 在 Qk 与轨迹分布下的期望,uk(τ) ∈ [0, 1]。uk 只能通过结果和人类反馈观察,智能体针对估计 Rk 优化,且 Rk(τ) ≈ uk(τ)。
联邦协议与三项目标
- 一轮协议:协调者的协议 Φ 规定每轮参与者 St、规则 Update、Agg、Adapt、上传保护方式和消息调度。第 t 轮先本地更新得到类型化 Δtk(策略、记忆、工具、奖励、知识五块,任一块可空,除此之外不得离开客户端),再聚合成视图 Gt+1,最后 Adapt。联邦平均给所有客户端同一视图;个性化方法给各自视图。附录 D 讨论无协调者的协议。A+k 是联邦后的最终智能体,Aloc_k 是不联邦时得到的智能体。
- 通信与泄漏:Ccomm 把协议中每条跨界消息按大小 |·| 加总。泄漏是随机机制 Mk 把 Dk 映到上传副本的性质。可选差分隐私:相邻数据集上输出概率比由 ϵ、δ 界定,保证覆盖全部 T 轮及其组合;或在给定威胁模型 A 下,用最强攻击相对“无上传”的命中优势。命中指恢复出与 Dk 中某条记录相似度至少为 γ 的内容。两种度量不可比,一个实例选定一种标量 Pk。作者指出梯度、嵌入、记忆和语言模型写出的文本都可能泄漏私有数据。
- 多目标与参与约束:定义 1 在协议 Φ 上最大化平均 Uk(A+k; Qk)、最小化平均 Pk 和 Ccomm。决策空间有三点不同于约束多目标联邦学习:更新块可以是参数、文本或图、规则等结构,聚合不能只做平均;效用是稀疏反馈下的轨迹期望,离散分量没有梯度,连续分量只有带噪声的梯度估计;可读产物可能逐字披露记录,泄漏面更宽。帕累托最优指没有其他可行协议在三项上都不差且至少一项更好。作者给出加权和与带预算约束两种标量化。正权重只能得到支撑在前沿凸包上的协议;因为含文本和规则的决策空间不凸,只有约束形式能保证达到每一个帕累托最优协议。理性客户端仅在协作增益 CGk = Uk(A+k) − Uk(Aloc_k) ≥ 0 时加入,这不是第四个目标。
按组件的分类
作者按式 (5) 中被共享的那一块分类,检索截至 2026 年 9 月 29 日。智能体级方法跨数据留在本地的客户端改进语言智能体的一个组件;先驱工作在智能体之外联邦同类组件。类别有重叠(附录 B)。
- 策略 Δπ:开源权重时客户端微调适配器,协调者按 wk 加权平均成一个公共视图;闭源骨干时共享文本提示词 pk,由语言模型合并。泄漏通道是梯度求逆,以及提示词中保留的私有例子。权重求逆可恢复训练文本,标准防御是安全聚合和差分隐私;提示词体积小,但每个接收者都可读。
- 记忆 ΔM:原始轨迹留在本地。客户端共享由抽象 α 抽出的洞察、工作流和推理策略,协调者压缩后,客户端在推理时检索与当前任务匹配的条目。文本可能引用私有内容,存储的记忆也可被抽出。FoT 用重构攻击审计上传;差分隐私文本生成可以补形式化保证。
- 工具 ΔT:水平设定下工具同类,标准接口使描述可比较。客户端共享文档以及调用次数 Nk 与成功次数 Nk+,协调者合并文档并计算成功率。只需计数之和,可用安全聚合。模式会暴露内部系统,共享描述对阅读它的每个智能体都是指令,聚合还要抵抗恶意贡献。
- 奖励 ΔR:客户端看到真实结果但数量少;协调者可以运行强评判器,但作者称评判器在轨迹上有偏且不可靠。共享评估器 gφ 与本地头 hψ 联合训练,只有 gφ 离开客户端。更省的形式只共享候选奖励与本地效用的相关分数,每客户端离开 J 个分数。作者称就其所知,尚无方法联邦智能体轨迹的评估器;已有工作联邦的是语言模型对齐用的偏好或奖励模型。
- 结构化知识与技能 ΔO:对实体嵌入做已知该实体的客户端上的平均;技能库交换本地补丁,服务器侧智能体为每个客户端合并出个性化视图。嵌入会暴露客户端知道哪些实体,技能会暴露业务做法。FedWorld 把环境动态规则标成共享、簇特异、私有或未决。
从经验到可迁移能力
- 改进回路:Update = ρ ∘ α。参数更新的 α 是本地训练;语义更新用某一抽象层级 ℓℓ 的 αℓ。四阶段是本地证据到产物 z、保护得到 z̃、聚合为 Gk、适配为 A+k。支持度低于 nmin 的模式被丢弃,否则 Sanitize 去掉标识符或加校准噪声。抽象层级在式 (13) 的同一目标下与协议一起选择。作者认为更高抽象通常应缩小产物、降低泄漏并扩大可达范围,但抽象业务规则本身也可以是商业秘密。自私客户端会尽量少上传,即搭便车,由激励应对。
- 五类共享知识:功能不同,不是抽象程度的分级。经验模式来自成败;技能是参数化流程;规则描述动作在环境中的效果;奖励是评估器或量规;本体对齐概念。它们会相互作用:对齐的本体便于把经验、技能和规则落到本地,奖励类型提供发送方提炼时用的评估器。任一类型的产物都可以进入接收方的记忆、提示词或评估器(附录 C)。Table 2 用银行身份核验作为贯穿例子,说明各类产物长什么样,此处不复述例子中的业务规则。
- 何时互利:Ij→k 是扣掉客户端 j 的更新后,k 的效用下降量。互利要求双向贡献都为正。对客户端子集平均后的边际贡献给出 Shapley 值。三条启发式是任务分布散度不超过 divmax、相对已知条目的新颖度、以及所用概念和工具能在接收方落地。作者写明它们不是必要条件。针对负迁移的门控把条目逐条加入,仅当估计增益不低于两倍误差界 ek 才接受。用 nval_k 条来自 Qk 的留出任务估计效用,Hoeffding 不等式加对 2^m 个可达智能体的联合界给出:协作增益非负的概率至少为 1−η。作者称这保证个体理性,即式 (16),裕度随 m 增大,因此需要过滤或分批。式 (28) 的成对互利更强,命题 2 推不出,因为不同客户端的条目会相互作用。把收益绑到贡献上的激励用于应对只采纳、不承担隐私成本的客户端。
与已有范式的关系
式 (17) 把联邦学习、经验池化(Δk = Dk 且 λp = 0)、单智能体优化(K = 1)和只联邦一个组件(λp = λc = 0)写成 FAO 的特例。作者称就其所知,没有方法跨组件权衡式 (10) 的三个目标。
论文做了哪些实验?
本文没有新实验;只汇总已有方法的更新体积、泄漏通道,并给出参与约束的概率界。
实验设置
- 本文实验:论文未报告作者自己运行的实验、被测模型、样本量或重复次数。第 4 节是对已有方法的分类,第 5.3 节是门控的概率界,不是实测。
- 分类范围:作者检索 arXiv、ACL Anthology、OpenReview 和主要机器学习会议论文集,截止 2026 年 9 月 29 日,关键词为 federated 与 agent、memory、tool、skill、reward model、prompt 或 knowledge graph 的组合。
- 对比对象:Table 1 把工作分成智能体级方法与先驱。智能体级指数据留在本地、改进语言智能体某一组件;先驱指在智能体之外联邦同类组件。奖励一行的智能体级方法为空。
- 文中出现的系统与方法名:策略侧包括面向 GUI 智能体、在成功轨迹上调优或用强化学习调优的工作,以及跨组织工作流;记忆侧点名 FoT、FedAgentKE 和联邦检索增强生成;工具侧点名 FICAL 和类型化产物;知识侧点名 FedE、FedR、FKGE、FedLU、FedWorld、FederatedSkill。这些是文献中的方法,不是本文的实验对象。
- 指标:形式化指标是 Uk、Pk(差分隐私或攻击优势)、Ccomm 和协作增益 CGk。论文没有在统一基准上测量它们。
- 通信体积的出处:式 (24) 的数量来自作者对文献的汇总,分别对应 rank 8 适配器每轮 [35]、工具知识每次运行或每轮 [200, 25]、技能补丁每次运行 [209]。论文未说明这些数字是作者复现还是从原文摘录。
主结果
没有作者自己的主结果表。能回查的定量汇总只有通信体积,作者称各类载荷大约相差三个数量级(第 4 节 Comparison):
表格较宽,可左右滑动
更新类型 报告的体积 条件(论文写法) 出处 Policy Δπ ≈ 76 MB rank 8 适配器,每轮 式 (24),引 [35] Tool use ΔT ≈ 0.08 到 20 MB 工具知识,每次运行或每轮 式 (24),引 [200, 25] Structured knowledge ΔO ≈ 0.1 到 0.3 MB 技能补丁,每次运行 式 (24),引 [209] - 作者称交换文本或规则的方法 [200, 212, 109, 209, 75] 把原始轨迹留在本地,但没有使用形式化隐私机制,其中两个对上传做了经验审计 [212, 209]。
- 作者称参数更新也可以压缩到 kilobytes [151]。论文未报告压缩后的具体字节数。
- 作者称就其所知,没有方法跨组件权衡三个目标。奖励组件在 Table 1 中没有智能体级方法,只有先驱 [199, 168] 和 [90]。
负迁移门控的理论保证
- 测的是什么:第 5.3 节不报告实验,只证明一个接纳门控。条目逐条加入本地智能体,估计增益不低于 2ek 才接受。Ûk 是 uk 在 nval_k 条留出任务上的均值。
- 结果:ek 等于 sqrt( ((m+1) ln 2 + ln(1/η)) / (2 nval_k) )。作者由 Hoeffding 不等式和对 2^m 个可达智能体的联合界得到 Pr(CGk ≥ 0) ≥ 1−η。论文未给出 m、nval_k 或 η 的具体取值,也没有数值验证。
- 作者的解读:该门控以高概率保证个体理性,即参与约束 (16)。裕度随条目数 m 增大,因此需要过滤或分批。成对互利不被该命题蕴含,因为不同客户端的条目会相互作用。
作者对迁移条件的讨论
- 启发式:式 (29) 用任务分布散度、新颖度和可落地性(概念落在对齐的定义域内、所用工具属于接收方工具集)描述有利于迁移的情形。作者写明这不是必要条件:远距离任务可以共享策略,已知条目可以增加鲁棒性,条目也可以带来新概念或新工具。异构既是障碍也是价值来源。
- 已有证据的转述:作者称聚类聚合处理相关性 [57, 164];联邦强化学习训练的智能体可以容忍任务差异,但不能容忍环境动态差异 [29]。论文未报告这些结论对应的数值。
- 相关机制:FedWorld 检查每条规则的适用范围 [75],Agent KB 用分歧门控过滤检索到的知识 [174],FederatedSkill 为每个客户端建库 [209]。论文未报告这些机制的通过率或效用变化。
其他消融与分析
论文没有消融或参数实验。附录中的命题是关于标量化与帕累托集的包含关系,以及上述门控的概率陈述,没有数值表。Figure 1 是一轮 FAO 的示意图:客户端上传 Δk,协调者聚合成 Gk,客户端再适配;效用在 A+k 上测量,泄漏看 Δk,通信代价看每条跨界消息。图中没有数值。
有什么可以进一步探索的点?
作者把可靠执行、隐私与恶意更新、公平、评测和全生命周期成本列为开放问题。
作者指出的局限与后续方向
- 三项目标耦合:性能、隐私和通信不能分开优化。更强的差分隐私会降低可用于优化的信息,激进压缩可能去掉能力迁移所需的信息,安全聚合限制直接检查共享内容,客户端异构会改变同一更新的效用并带来全局优化的目标不一致。作者把找出在显式隐私和通信预算下仍能迁移能力的工作点视为核心系统问题(第 6.1 节)。
- 公平:联邦整体效用的提高可以与个体结果的很大差异并存。有的智能体贡献高价值经验但回报有限,有的主要受益于别处产生的知识;全局共享能力在目标、任务分布、工具或运行约束不同时会造成负迁移。贡献估计困难,因为结果来自长决策序列,反馈稀疏或延迟,把接收方收益归因到某次共享还要做信用分配。作者称第 5 节的协作增益和成对贡献只是起点,完整公平框架还要同时考虑贡献、收益以及隐私、计算和通信成本(第 6.2 节、第 7 节问题三)。
- 评测:智能体表现依赖推理、记忆检索、工具执行和环境条件的交互,语义上成立的共享产物迁移后仍可能失败。持续优化会引入过时能力、分布漂移和对已有知识的干扰,错误或对抗性贡献使真实改进与有害更新更难区分。作者称现有智能体基准和 FedScale 是起点,FAO 还需要受控的客户端异构、明确的信息共享边界、反复协作优化、可信的本地基线,并报告泄漏、通信与系统成本、客户端级协作增益、贡献公平、负迁移率和漂移下的鲁棒性(第 6.3 节、第 7 节问题四)。
- 跨环境可执行性:对一个智能体有效的能力可能依赖特定工具、接口、权限、任务分布或工作流上下文。作者认为未来系统应显式建模适用条件、依赖和执行约束,而不是假设跨智能体迁移后仍然有效(第 7 节问题一)。
- 隐私与恶意贡献:原始数据留在本地并不能消除参数、记忆、文本抽象、工具知识和结构化表示的泄漏。作者认为未来研究应同时考虑机密性、更新完整性和“保护共享信息”与“校验其质量”之间的张力,并用鲁棒聚合容忍故障或对抗参与者(第 7 节问题二)。
- 全生命周期成本:只计通信量不够。协作还可能在本地适配、隐私保护、校验、推理、工具执行、存储、同步和持续维护上产生成本,异构计算和模型容量下尤其如此。作者认为应建立覆盖生产、保护、聚合、校验、部署和维护的生命周期成本模型。附录 D 把形式化扩展到推理成本和随时间变化的任务分布,正文未把它当作已完成的度量(第 7 节问题五)。
实验覆盖范围
- 全文是定义、分类和挑战分析。作者检索截止 2026 年 9 月 29 日,分类对象是文献中的联邦方法,按 Table 1 的五类组件组织,奖励类没有智能体级方法。
- 定量内容是式 (24) 对三类更新体积的文献汇总,以及第 5.3 节门控的概率界。论文未报告 m、nval_k、η 的取值,也未报告该界的数值检验。
- 通信、泄漏和效用没有在同一协议、同一组客户端上联合测量。作者写明交换文本或规则的若干方法没有形式化隐私机制,其中 FoT 与 FederatedSkill 做了经验审计,论文未报告审计的攻击设定和命中率。
- 形式化覆盖水平设定、有协调者的协议,以及附录 D 中无协调者协议、推理成本和时变任务分布的扩展。个性化体现在每客户端自己的视图 Gk 和参与约束 CGk ≥ 0。
- 第 6.3 节点名的评测起点是通用智能体能力、网页与桌面交互、工具–用户工作流基准和 FedScale。作者说明 FAO 还要求信息共享边界、异构参与者、反复协作和纵向的接收方增益,论文未报告这样的协议或结果。
总结一下论文的主要内容
FAO 把智能体协作写成效用、隐私和通信的多目标问题,并给出组件分类与迁移框架。
Federated Agent Optimization(FAO) 是一篇框架论文:多个处在私有环境中的 LLM 智能体,如何在原始数据、完整轨迹和本地知识不离开客户端的前提下协作改进。
- 问题:企业智能体的可复用经验分散在各机构,又与用户数据、业务规则和专有工具绑在一起。传统联邦学习主要聚合参数。作者认为策略、记忆、工具使用、奖励和结构化知识同样决定能力,因此需要新的优化问题。
- 形式化:水平设定下 K 个客户端各持五元组智能体。协议每轮做类型化本地更新、聚合和本地适配。目标是提高各客户端在自己任务分布上的效用 Uk,降低泄漏 Pk(差分隐私或相对无上传的攻击优势),并降低按消息大小计的通信 Ccomm。理性参与还要求协作增益 CGk 非负。因为决策空间含文本和规则、不是凸的,作者认为只有带预算的约束形式能保证达到每一个帕累托最优协议。加权和只能得到前沿凸包上的协议。
- 分类与迁移:按共享的那一块,把文献分成策略、记忆、工具、奖励、结构化知识与技能。原始轨迹留在本地,语义更新经过抽象、按支持度过滤和清洗、聚合、再适配。五类共享知识按功能区分。负迁移用留出任务上的逐条门控控制,作者给出协作增益非负的概率至少为 1−η 的界,并说明这不蕴含成对互利。
- 文献中的体积:作者汇总称 rank 8 适配器每轮约 76 MB,工具知识约 0.08–20 MB,技能补丁约 0.1–0.3 MB,大约相差三个数量级。交换文本或规则的方法未加形式化隐私机制。作者称尚无方法跨组件权衡三个目标,也尚无智能体轨迹评估器的联邦方法。
- 作者的结论:三个挑战是性能–隐私–通信的耦合、异构参与者之间的公平、以及联邦增益难以核验。作者把可信 FAO 写成同时处理可执行性、隐私与抗恶意更新、公平分配、相对本地基线的评测,以及全生命周期成本,并设想它成为企业智能体在保持本地专门化和组织控制的同时利用集体经验的基础。