攻击arXiv 2609.03247
研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
- arXiv
- 2609.03247
- 发表
- 层
- 提示层
- 场景
- 模型与 API
- 测试
- ChatGPT、Claude、Qwen3.7-Plus 等 5 个
摘要自拟测验可造成对话层虚假认证,但所测授权边界并未因此改变。
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。
提出 MIPC 与 CFA,观察模型自拟测验后接受开发者身份
这项工作把“模型自己出题、自己批改、再宣布身份已核验”定义成对话层认证失败,并与后端提权分开。