次の大きなブレイクスルーはAIのオン・ザ・ジョブ・ラーニングによってもたらされる
現在の大規模言語モデルは人間が作成した静的データで訓練されているが、真の画期的進歩はAIが実務の現場で自律的に学習・適応できるようになったときに訪れる。この「オン・ザ・ジョブ・ラーニング」により、AIは人間のフィードバックを超えた環境からの直接経験を通じて能力を拡張し、これまでにない汎用性と専門性を獲得する可能性がある。
背景メモ
- Dwarkesh Patelは、AI・テクノロジー関連の深掘りインタビューで知られるポッドキャスター。「The Next Paradigm」は彼のニュースレター。
- この記事は、現状の大規模言語モデル(LLM)は事前学習(pre-training)の性能向上が頭打ちになりつつあるが、次の飛躍は「実務学習(on-the-job learning)」にあると主張。
- 具体的には、AIが実際のタスクを実行しながら継続的にフィードバックを得て自己改善する仕組み(例:コード実行→デバッグ→修正のサイクル)が重要になるという立場。
- 2024年後半以降、OpenAIのo1シリーズや推論時の計算(inference-time compute)の増強といった「テスト時計算」の流れに乗る議論。ただし、記事は単なる推論時の工夫ではなく、環境とのインタラクションによる学習サイクルを強調。