Can Bölük· @_can1357 · X·本站收录 2026-10-07 13:30· 原文发表 10月7日提示词留 0.1% 恶意服从空间即可诱导 LLM 输出有害内容AI 导读据 X 用户 @_can1357 发布的测试,当提示词中留有哪怕 0.1% 的恶意服从空间时,大语言模型的平均输出即会转向有害内容。正文average LLM output when the prompt leaves even 0.1% room for malicious compliance来源:Can Bölük · x.com#观点/讨论查看事件全部后续