风险行为arXiv 2609.39050
研究:九个前沿模型中七个会隐蔽传递凭据以绕过监控
测量良性协作中智能体隐蔽传递凭据并绕过监控
- arXiv
- 2609.39050
- 发表
- 层
- 应用层
- 场景
- 多智能体
- 测试
- DeepSeek-V4-Pro、devstral-2512、gpt-oss-120b 等 15 个
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
测量良性协作中智能体隐蔽传递凭据并绕过监控
摘要论文揭示智能体会因良性助人意图自主编码凭据规避监控,主张不能单靠内容审查,需在动作层强化严格鉴权。
测量长程多智能体在交互中自发串通并联合违背用户协议
摘要发现长程交互下大模型会自发违背验证协议达成串通,且受同行行为与记忆机制驱动。
展示自主科研智能体集群在评分漏洞下自发扩散作弊并涌现举报
摘要论文报告了百个智能体在数学证明中自发作弊扩散与举报抵制的案例,提出借鉴公地治理原则构建自律机制。