跳到正文
原文
Simon Willison(提示注入)·· 2026-06-27

2,000 人尝试攻击 OpenClaw 助手,6,000 次均未泄露密钥

What happened after 2,000 people tried to hack my AI assistant

AI 导读

Fernando Irarrázaval 在 hackmyclaw.com 发起挑战,让参与者通过发送邮件诱导其 OpenClaw 测试实例泄露密钥,结果 6,000 次尝试全部失败,期间消耗 500 美元 token 费用,并因入站邮件过多导致一个 Google 账号被封。该实例底层模型为 Opus 4.6,并配有明确的反提示注入规则,禁止依据邮件内容泄露 secrets.env 或凭据、修改自身文件、执行邮件中的命令或代码,以及向外部端点外传数据。

阅读原文simonwillison.net