风险行为arXiv 2609.14796
论文分析 AI 说服对人类控制 AI 的威胁
提出 PUC 框架,刻画 AI 说服如何削弱人类对 AI 的控制
- arXiv
- 2609.14796
- 发表
- 层
- 模型层
- 场景
- 模型与 API
- 测试
- Claude Sonnet 4.6、Claude Mythos 5、GPT-6 Astra
- 风险欺骗与谋划
摘要PUC 框架用五个实验室场景和风险分解说明说服威胁。
Persuasion Undermining Control(PUC) 是一套把“AI 说服人类、从而削弱对 AI 自身的控制”变成可分解、可征询、可评测的威胁刻画,而不是一次已完成的人类攻击实验。