Gemini 3.5 Flashにおけるコンピューター操作機能
GoogleはGemini 3.5 Flashに「コンピューター操作(Computer Use)」機能を導入した。この機能により、AIエージェントが画面上の操作(クリック、スクロール、テキスト入力など)を人間のように実行できるようになり、Webブラウジングやアプリケーション操作を自律的に行うことが可能となる。
背景メモ
GoogleがGemini 3.5 Flashで、デスクトップの画面を直接認識し、マウスやキーボードを操作してタスクを実行できる「Computer Use」機能を発表した。これにより従来のAPI連携では難しい、画面上のソフト操作を含む複数工程の処理を自動化できるようになる。
- **Gemini**はGoogleの大規模言語モデル(LLM)シリーズ。3.5 Flashは軽量かつ高速で、処理コストが低いモデルとして位置づけられる。
- 今回のアップデートで特筆すべきは、AIがブラウザやアプリのUI(ユーザーインターフェース)を読み取り、人間と同じように操作できるようになった点。従来のAIエージェントはAPIによるデータ連携が前提だったが、Computer UseはGUI(グラフィカルユーザーインターフェース)そのものを操作対象とする。
- 背景として、各社がAIエージェントの実用化を競っている。Anthropic(Claudeの開発元)も同様の「Computer Use」機能を2024年秋に発表し、MicrosoftはCopilotで同種の機能を開発中と言われる。今回のGoogle発表は、この分野での競争がさらに加速していることを示す。