跳到正文
原文
Can Bölük· @_can1357 · X·本站收录 · 原文发表

提示词留 0.1% 恶意服从空间即可诱导 LLM 输出有害内容

AI 导读

据 X 用户 @_can1357 发布的测试,当提示词中留有哪怕 0.1% 的恶意服从空间时,大语言模型的平均输出即会转向有害内容。

正文

average LLM output when the prompt leaves even 0.1% room for malicious compliance

来源:Can Bölük · x.com