研究提出 AI Agent 种群生态理论:协作带来起飞临界规模
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
- arXiv
- 2610.12436
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险失准与价值偏离
摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
另有 232 篇论文还没打上分类标签,暂不在筛选结果里。
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
提出研究合同,把已批准选择绑定到执行证据并由检查器核验
研究合同用来核验计算科学研究智能体是否仍在已批准研究之内,不判断科学是否为真。。
提出 RSIGym 环境,评测研究智能体的递归自改进
提出 comprehension audits,以人类理解证据作为继续研发门槛
本文是一份研发过程保障提案:用 comprehension audits 检验责任人是否理解 AI 参与产生的研发贡献,未达标就暂停后续开发与依赖该贡献的发布。。
实现 DEFER,以确定性检查优先拦截多智能体流水线的内容攻击
DEFER 用来测量多智能体授权流水线里,确定性规则在何处结束、LLM judge 从何处开始。
提出 TasteVal 基准,衡量模型设计实验并解释结果的研究品味
构建 BazaarBench,评测 C2C 市场中 Agent 的违规与失信行为
BazaarBench 针对大语言模型智能体在去中心化 C2C 交易中的代理安全问题,提出了一个结合底层实体状态与大模型裁判的仿真基准平台。
提出 multi-CaMeL,在智能体调用边界隔离可信指令与非可信数据
摘要论文针对多智能体中单体防御不组合的边界清洗问题,提出 multi-CaMeL 协议彻底阻断了 MultiAgentDojo 上的注入攻击。
提出 AutoSciBench,循环生成科学智能体评测任务
AutoSciBench 研究科学智能体基准能否自动构造,并随 solver 行为迭代改编。
提出 MASBench,评测部分可观测下的多智能体协作机制
MASBench 用部分可观测任务比较 LLM 多智能体的协作机制,而不是只看端到端能否做完。
对自主 LLM 智能体日志做身份盲置换以量化串通
作者把 Nightingale Collective 所记的 wiki 旁路事件,做成相对身份置换零模型的定量配套,并写出四类会使协调检验失真的构造错误。
提出检测、结构化与 GSPO 流程,降低共识生成的提示注入错位
这是一篇把 LLM 数字孪生放进增强民主的博士论文,分个体表示、政党聚合和共识生成的提示注入三章。
提出 EvalResearchBench,评测智能体自建评测对目标基准的排序一致性
ERB 用来测一件事:智能体在固定预算内做出的可执行评测,能否复现既有基准对候选模型的分数和排序。
测量多智能体博弈中数值信号的结构及其对合作的影响
四种 LLM 在四个经典两人博弈中交换无预设语义的数字时,消息结构可以跨模型出现,合作水平的变化则不能跨模型外推。
提出 SceneFactory-3D,用路况反事实评测驾驶策略的闭环安全性
SceneFactory-3D 是 GPU 批处理的多智能体驾驶仿真器,用来在场景和控制器固定时只改路面物理,并比较闭环结果。
用 J-lens 检测辩论中屈从多数的智能体是否仍内部表征原前提
摘要揭示 LLM 智能体屈从多数时内部仍表征原推理前提,指出辩论表态共识可能夸大真实认同。
提出奖励驱动多智能体系统 MEA,生成可扰动验证的忠实解释
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。
提出 MIRROR,用多路径摘要多数表决保障多智能体通信完整性
MIRROR 是 LLM 多智能体通信层上的多路径法定人数完整性原语,只处理不透明字节,不解释消息内容。要处理的是 Agent-in-the-Middle:中介合法终结 TLS 后可改在途消息,而语义校验有推理开销和误拦,签名又要求私钥管理。做法是生成结束后复制同一规范化载荷。
提出 BDA,按辩证动作可靠性加权聚合多 LLM 议会以抵抗持续对抗
BDA 是一种不另调 LLM 的多 LLM 议会聚合方法,同时处理置信度校准和持续不可靠席位。
用均值场博弈分析多智能体集体攻击何时不是均衡
摘要结构阈值给出干预杠杆。