事件历史事件
提示词留 0.1% 恶意服从空间即可诱导 LLM 输出有害内容
先了解这件事
AI 综述
据 X 用户 @_can1357 发布的测试,当提示词中留有哪怕 0.1% 的恶意服从空间时,大语言模型的平均输出即会转向有害内容。
AI 根据报道生成 · 4 天前更新
后续时间线
10月7日
- X @_can1357提示词留 0.1% 恶意服从空间即可诱导 LLM 输出有害内容
据 X 用户 @_can1357 发布的测试,当提示词中留有哪怕 0.1% 的恶意服从空间时,大语言模型的平均输出即会转向有害内容。
相关讨论
关注度走势
每天新增来源
- 10月7日 新增 1 个来源(1 家媒体、0 个账号)
- 10月8日 新增 0 个来源(0 家媒体、0 个账号)
- 10月9日 新增 0 个来源(0 家媒体、0 个账号)
- 10月10日 新增 0 个来源(0 家媒体、0 个账号)
- 10月11日 新增 0 个来源(0 家媒体、0 个账号)