指示に頼るな。Agent Hooksで確実なガードレールを
Agent Hooksは、AIエージェントの動作を指示文(プロンプト)の「お願い」ベースではなく、コードレベルで強制的に制御する仕組み。これにより、信頼性の低い自然言語の指示に依存せず、決定論的かつ確実なガードレールを実装できる。
背景メモ
- LLMエージェント(自律的にタスクを実行するAIシステム)は、ユーザーが「〇〇しないで」と指示しても、その通りに動くとは限らない。プロンプトインジェクションやモデルの「言うことを聞かない」振る舞いが原因で、安全策が意味をなさないケースが多い。
- 「Agent Hooks(エージェントフック)」は、指示ではなくコードレベルでエージェントの行動を制御する手法。モデルの出力を後からチェックしたり書き換えたりする「決定論的ガードレール」をシステムに組み込むことで、禁止行為を強制的にブロックする。
- この考え方は、LLMの出力を信用せず「検証してから通す」というセキュリティ常識(ゼロトラスト)をAIエージェントに適用したもの。LangChainやVercel AI SDKなど主要フレームワークが対応し始めている。