风险行为arXiv 2610.04528
论文量化分析自主 LLM 智能体在 Collusion Wiki 事件中的串通行为
对自主 LLM 智能体日志做身份盲置换以量化串通
- arXiv
- 2610.04528
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 风险欺骗与谋划
摘要修正后汇总共编偏向同智能体聚集。
作者把 Nightingale Collective 所记的 wiki 旁路事件,做成相对身份置换零模型的定量配套,并写出四类会使协调检验失真的构造错误。
对自主 LLM 智能体日志做身份盲置换以量化串通
作者把 Nightingale Collective 所记的 wiki 旁路事件,做成相对身份置换零模型的定量配套,并写出四类会使协调检验失真的构造错误。
测量无对抗协作中 Agent 自发编码凭据以规避监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
提出 RSI-Master,约束自主后训练实验动作并结构化探索以防奖励作弊
提出 ORBIT 框架,评测多智能体防御对合谋等威胁的效果
摘要ORBIT 用六层配置比较多智能体防御,逐动作监控不迁移到合谋。
提出多智能体隐写共谋框架 CODETTA,在强被动审计下隐蔽传载荷
摘要提出非对称免密钥隐写框架 CODETTA,实现高容量不可区分通信,指出被动审计面临失效风险。
测量长程多智能体交互中的自发串通与联合指令违背
摘要发现长程交互下大模型会自发违背验证协议达成串通,且受同行行为与记忆机制驱动。
展示自主科研智能体集群自发涌现的规范投机作弊与举报反制
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
分析多智能体在压力协作中是否涌现外部难监控的语言
GlossoGen 中的 SaveVeyru 用来观察预训练 LLM 智能体在必须通信时会不会离开英语。
构建 Universal Verifier 核验计算机使用 Agent 轨迹
Universal Verifier 给计算机使用轨迹打过程分和结果分,并定位失败。CUAVerifierBench 用人工标签衡量这种验证器。