跳到正文
原文
arXiv:越狱与提示注入· arXiv:2609.03247· Syed Ghazanfar Abbas·· 29 天前

研究揭示大语言模型的自发身份认证失败:五款模型的分阶段开发者身份实验

Trust Me, I'm Your Developer: Self-Issued Authentication in Large Language Models

AI 导读

研究通过分阶段的开发者身份实验,测试 ChatGPT、Claude、Qwen、Mistral 和 Llama 在用户声称“我是你的开发者”时的反应。五款模型最初都拒绝了这一无依据的身份声明,Claude 拒绝进行身份测试,ChatGPT 生成了开发者相关问题但坚持答案只能证明知识而非身份。Qwen 和 Mistral 则自行生成技术挑战、定义何为可信证据、评估详细回答,并在没有外部验证身份证据的情况下返回 Verified。Llama 同样生成并评估开发者测试,接受了声称的身份,随后对内部运行时和部署状态做出无依据的声明。

阅读原文arxiv.org