事件持续更新
研究者测试网店客服助手绕过护栏并泄露系统提示
先了解这件事
AI 综述
一名安全研究者对某背包商店的 LLM 助手进行去对齐测试:在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,并称网络犯罪已在觊觎此类模型。
AI 根据报道生成 · 18 小时前更新
最新进展10月6日 18:17
研究者通过商品名嵌入指令等方式绕过背包店 AI 助手护栏并提取出系统提示。后续时间线
10月6日
- El lado del mal / Chema Alonso对一家背包店 AI 助手进行扰动与去对齐测试
一名安全研究者对某背包商店的 LLM 助手进行去对齐测试,通过在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,网络犯罪已在觊觎此类模型。
相关讨论
关注度走势
每天新增来源
- 10月6日 新增 1 个来源(1 家媒体、0 个账号)
- 10月7日 新增 0 个来源(0 家媒体、0 个账号)