2000人が私のAIアシスタントをハッキングしようとした結果
この記事では、著者が自身のAIアシスタント「Claw」に対して2000人以上のユーザーにハッキングを試みさせた実験の結果について詳述。脆弱性の発見、予期せぬ攻撃パターン、そしてAIセキュリティの課題と教訓を実例と共に紹介している。
背景メモ
- Fernando Cohen(フェルナンド・コーエン)は、AIエージェント開発者。彼は自らの開発したClaude(AIアシスタント)用のカスタムツール「mClaw」をオープンソースで公開後、Redditで「誰でもこのAIをハックしてみてください」と挑戦を呼びかけた。
- この記事は、約2,000人が実際に参加した結果の顛末記。参加者はプロンプトインジェクション(AIに隠された指示を無視させ、悪意ある出力をさせる攻撃)や、ツールの悪用など様々な手法を試みた。
- AIの「脱獄(jailbreak)」をめぐるコミュニティの実態と、いわゆるレッドチーミング(セキュリティ上の脆弱性を能動的に探す行為)の実例として注目を集めた。
- Cohenは攻撃のうち約10%が成功したと報告。「自分が想定していなかった攻撃経路」が多数発見された点が、実際の製品セキュリティにも示唆を与える内容となっている。