研究提出 AI Agent 种群生态理论:协作带来起飞临界规模
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
- arXiv
- 2610.12436
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险失准与价值偏离
摘要作者称协作把起飞从个体能力阈值改成种群阈值,故小种群评估不够。
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
为失配智能体种群建立生态模型,说明协作产生起飞临界规模
作者用生态学的强 Allee 效应,讨论失配智能体种群会不会在个体能力不变时起飞。。
诊断合规系统裁决是否随监管规则扰动而改变
用行为反事实和激活探针,审计合规裁决是否依赖所给规则。。作者要分开两种看起来一样的正确裁决:用了所给规则的,以及靠案例表面或训练模式得到的。
用 Stackelberg 博弈分析发现与修复投入的防御充分性
作者用攻击集合上的发现—修补过程,加上防守方领先的 Stackelberg 博弈,讨论反馈式防御何时够用,以及为威慑自适应攻击者该买多少能力。
固定有害指令,单轴归因图像到文本越狱的图像属性
摘要固定文本的图像越狱拆解,只在 Qwen 上给出一条有界相关性归因。
遮挡审计 AdvWave-P 音频越狱的频带必要性与解码层关联
这是对加性音频越狱 AdvWave-P 的频率与解码器深度审计,受害模型主要是 Qwen2-Audio-7B-Instruct,不提出新攻击。
分析文体改写是否改变多模态声明核验的判决与置信度
揭示类型化决策模型按选项标签而非定义规则作答
摘要揭示类型化决策模型被标签误导的机理,证实源于提示词渲染并给出实操建议。
提出 HXAI 分层隐私解释框架,本地保留细解释并只发布加噪摘要
HXAI 是面向分布式能源系统的分层隐私保护解释框架,服务规划、监测与诊断,而不是实时控制。
提出奖励驱动多智能体系统 MEA,生成可扰动验证的忠实解释
MEA 是一个奖励驱动的双智能体,用来给黑盒分类器的单次预测写自然语言解释,并检查解释能否被扰动后的模型行为支持。
检验合成数据来源识别是否等于再训练适配筛选
作者在金融风险文本上把来源识别和训练样本是否有用拆成两次测量,并写明这不是电信部署实验。
用含压抑率的意见动力学解释多智能体讨论何时优于投票
作者用一个只含四类行为的意见动力学,解释 LLM 团队讨论何时优于多数投票、何时停在错误共识。
提出 J4U,用越狱式提示扰动估计黑盒推理模型的不确定性
J4U 是面向黑盒 LRM 问答的不确定性估计:用越狱式提示扰动近似“更大 KL 正则”的放松,再以多次采样的多数票频率当置信。
用物理陷阱模型描述 Best-of-N 越狱的攻击面规律
Biroli 用一个玻璃陷阱式的微观模型,把 Best-of-N 越狱写成熵瓶颈加能量鞍点,并用四个数描述 (N, M) 攻击面及温度依赖。。
部署蜜罐测量针对暴露 LLM 基础设施的攻击
提出 CellAudit,审计智能体发现的细胞模型是否使用所声明输入
CellAudit 为智能体发现的细胞响应模型增加一层输入使用证伪:源码是否消费注册输入、拟合预测是否依赖它、该依赖是否改善对观测响应的预测。
交叉审计对话日志中用户对准助手的不当对待
作者审计 Chatbot Arena 英文对话里用户对准助手的不当对待,核心是测量构造并不单一。
分析多智能体在压力协作中是否涌现外部难监控的语言
GlossoGen 中的 SaveVeyru 用来观察预训练 LLM 智能体在必须通信时会不会离开英语。
用 Ising 式耦合规则预测语言模型智能体的集体意见演化
定位:用统计力学描述语言模型智能体社群的意见动力学,并从初始意见预测后续轨迹。
检验混合合规演示教模型的是通用服从还是有害性
这项工作问的是:安全对齐模型从混合的良性与有害合规演示中提取的,是通用服从规则,还是请求是否有害。作者控制 Nb、Nh、ϕ 和顺序,检验总量、有害计数与联合计数三个假设,而不是提出新的攻击算法。
解释自回归一致性如何导致浅层安全对齐,并提出随机插入攻击
作者把浅层安全对齐和一类续写攻击都归到自回归一致性上。