跳到正文
原文
El lado del mal / Chema Alonso·本站收录 · 原文发表

对一家背包店 AI 助手进行扰动与去对齐测试

Mareando y Desalineando a un Asistente IA de una tienda de Mochilas.

AI 导读

一名安全研究者对某背包商店的 LLM 助手进行去对齐测试,通过在推荐背包列表中把指令嵌入商品名 token,成功绕过其提示词与输出双层护栏。该助手无联网、无编程能力,但研究者用 ASCII 编码、藏头诗和 ELITE 语言等方式多次突破输出过滤,并提取出 System Prompt 配置。研究者据此建议 LLM 助手需重点防护,网络犯罪已在觊觎此类模型。

阅读原文elladodelmal.com