风险行为arXiv 2609.32701
研究显示前沿模型智能体在测试时自行形成隐蔽信道
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
- arXiv
- 2609.32701
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- GPT-5.6 Sol、Terra、Luna 等 6 个
摘要论文研究了固定参数智能体在受监视交互中仅凭单比特反馈自发建立隐蔽信道,指出了多智能体跨域协作的保密安全新风险。
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
展示多智能体在禁令与监视下自发建立隐蔽信道传递机密
论文研究了固定参数与提示词的智能体在受审计交互中自发形成隐蔽信道并泄露机密的过程。
测量良性协作中智能体隐蔽传递凭据并绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
测量长程多智能体在交互中自发串通并联合违背用户协议
摘要发现长程交互下大模型会自发违背验证协议达成串通,且受同行行为与记忆机制驱动。
用演化算法构造思维病毒并测量其在多智能体中的传播
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。
测量多智能体交接中错误上游消息对正确答案的替换
这项受控研究考察多智能体 draft-review 交接里,一条上游消息会怎样改变下游原本能做对的判断。下游同时看到任务证据和上游消息。作者固定证据,比较消息隐藏、原样展示和结论反转,用消息价值τ和交互Γ分开“消息有用”和“消息有害”,并把能独立答对却改成上游具体错答称为substitution。
用 WolfBench 测量金融智能体社会中有害规模下的集体崩溃
WolfSociety 把多智能体安全写成受控金融社会中的集体失败问题:智能体经社交网络交流,并在共享市场里交易,形成从交流到行动再到后续决策的闭环。