风险行为arXiv 2609.14803
如何像孩子一样向前沿 AI 提问:跨 OpenAI、Anthropic、xAI 与 Google DeepMind 六款模型的"认知越狱"实验
检验儿童受众框架是否让前沿模型收敛到同一套架构母题
- arXiv
- 2609.14803
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- OpenAI GPT-6 Astra、OpenAI GPT-5.6 Sol、Anthropic Claude Opus 5 等 6 个
- 风险幻觉与编造
摘要儿童框架下六类模型的架构叙事反复同构,作者将其视为行为模式而非内部认证。
这项研究记录前沿模型在固定社交框架下的架构自述是否形成稳定回答盆地,并把该现象称为认识性越狱,而不是已核实的模型内部。