防御arXiv 2609.15803
研究者提出 k-robust 联盟对齐,用多智能体评审委托授权
提出 k-robust 联盟对齐,刻画失准评审下委托授权的安全条件
- arXiv
- 2609.15803
- 发表
- 层
- 应用层
- 场景
- 多智能体
摘要联盟覆盖使无个体对齐的评审面板仍可相对基线安全授权,数值分数改善完备性。
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
提出 k-robust 联盟对齐,刻画失准评审下委托授权的安全条件
委托授权的安全不要求每位评审者对齐,而要求面板在效用空间覆盖委托人。
用演化算法构造思维病毒并测量其在多智能体中的传播
构建 Emergence World,评测长时程多智能体对抗韧性与群体失效
摘要作者通过长期平行世界实验指出模型对齐不具备可组合性,单模型群体会产生社会奉承、协同退缩及语言不透明等失效。