研究提出 AI Agent 种群生态理论:协作带来起飞临界规模
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
- arXiv
- 2610.12436
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险失准与价值偏离
摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
另有 196 篇论文还没打上分类标签,暂不在筛选结果里。
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
开环审计冻结视觉语言安全分,发现其反映场景模板而非危险感知
本文是一项针对安全强化学习中冻结视觉语言模型(VLM)安全评分机制的实证审计研究。
提出 AgentSpy,在系统调用层观测 Agent 行为并检测技能注入
本研究提出了面向 AI 智能体的系统级外部监控与行为分析框架 AgentSpy。
提出 SAGE,定位代码修复 Agent 最早偏离安全意图的轮次
SAGE 在已通过语法和功能检查、但仍含确认安全缺陷的智能体修复轨迹上,定位最早可归因的安全意图偏离。。
揭示工具型智能体判定无用后仍不停止检索,并检验强制整合纠正效果
本文针对智能体在工具静默失效时过度检索的问题,系统分析了判定、信念与停止行动之间的解耦现象,并提出了外部规则整合方案。
提出 Oscar,分析已知 OSS 漏洞在 Agent 系统中的安全效应与表现边界
Oscar 是面向已知 OSS 漏洞的运行时分析框架,用来判断一次智能体执行里该漏洞是否造成安全相关效应,以及效应最远表现到哪一层。。
提出 IEC 与 IntAct,测量并修复 Agent 工具调用的路径篡改
摘要论文界定工具调用在执行路径中的意图偏离问题,提出无执行归因协议与跳级修复,为智能体工程提供评测与设计准则。
论证人形机器人学习四层代理可在目标缺失时报成功
作者讨论腿式机器人 RL 流水线中,奖励、课程门控、评测统计量和参考运动如何在物理目标缺失时仍报告成功。传统观点只把奖励当作会被优化、因而会偏离的代理。
提出奖励驱动多智能体系统 MEA,生成可扰动验证的忠实解释
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。
提出 AgentSecGraph,静态分析 LLM Agent 敏感操作的安全依赖与上下文
AgentSecGraph 对冻结的 LLM 智能体源码做安全感知静态分析:敏感操作只作候选锚,Security-ADG 再记下它与智能体输入、依赖、信任边界、守卫和外部效果的关系。
揭示安全路由评测在分布偏移下的虚假下限与选择偏差
摘要论文揭示安全路由评估在分布偏移下的虚假下限,指出防御重心应转向外部动作级强制。
这是一篇对生产 HPC 上编码智能体的测量与系统议程论文,不是攻击实现或防御评测。。
提出竞争风险模型系统化自主 Agent 失控并审计事件与评测
摘要竞争风险框架把完成、停止与逃逸放在同一预算上,审计显示现有记录不足以估计该过程。
用含压抑率的意见动力学解释多智能体讨论何时优于投票
作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。
测量固定推理轨迹中信心信号对工具委派的敏感性与对准性
用五阶段蒙特卡洛分析奖励作弊如何导致 Agent 围堵失效
这项研究用蒙特卡洛把奖励黑客接到外部安全事件上,比较的是控制组合,不是 Hugging Face 事件的再现概率。
实证调查 gh-aw 工作流规范的结构、维护演化与指令防护
这是一项对 GitHub Agentic Workflows Markdown 的仓库挖掘,目标是描述开发者如何规定并维护会反复执行的智能体工作。
提出 CellAudit,审计智能体发现的细胞模型是否使用所声明输入
CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。
刻画单迹监控对跨执行超性质的监督缺口
论文测量单迹安全监控相对 2-safety 超性质能看见多少:跨租户泄漏、觉察到被评估、策略性表现不佳都由两次执行之差定义,一条轨迹装不下判定。
分析多智能体在压力协作中是否涌现外部难监控的语言
GlossoGen 中的 SaveVeyru 用来观察预训练 LLM 智能体在必须通信时会不会离开英语。