当2000人试图破解我的AI助手后发生了什么
Fernando Irarrázaval 在 hackmyclaw.com 上发起挑战,看是否有人能通过发送电子邮件泄露他 OpenClaw 测试实例中的秘密。在经历约6000次尝试(消耗500美元代币,且因入站邮件过多导致谷歌账户被暂停)后,竟无一人成功。底层模型为 Opus 4.6,配合明确的防提示注入规则。作者指出,前沿模型在抗注入攻击方面的训练确实有效,但警告称,6000次失败并不意味着更复杂的攻击无法得手,不建议在可能造成不可逆损害的生产系统中仅依赖此保护。
背景速读
- 提示注入(Prompt Injection)是AI安全领域的核心攻击手法:攻击者通过向AI助手发送看似无害的指令或邮件,试图诱骗模型泄露机密信息、执行危险操作或绕过安全限制。比如让AI忽略系统级指令、读取环境变量中的密码等。
- OpenClaw 是一个AI助理项目(类似定制版Claude),作者 Fernando Irarrázaval 搭建了公开测试站 hackmyclaw.com,故意放置一个假秘密文件,邀请网友发邮件尝试骗AI泄露它。
- Opus 4.6 是Anthropic公司开发的Claude系列前沿模型,被认为在抵御提示注入方面有显著提升,也是本次测试中未被攻破的底层模型。
- 这场"攻防实验"共收到约6000次攻击尝试,消耗500美元API费用,甚至导致作者谷歌账号因大量入站邮件被封——但无人成功获取秘密。评论普遍认为这不代表绝对安全,高端攻击者仍可能得手。