AIの中心にあるデータのブラックホール[動画]
AI開発は膨大なデータを消費するが、そのデータがどこから来て、どのように使われ、そして消えていくのかは不透明だ。この動画は、AI産業の中心で進行する「データのブラックホール」現象を解説する。データの出所や利用実態の見えない闇に迫る。
背景メモ
• 本動画は、AI業界が直面する「データのブラックホール」問題を扱っている。AIモデルの性能向上に必要な高品質な学習用データが急速に枯渇しつつあり、特に英語のテキストデータは2026〜2027年にはほぼ使い尽くされるとの試算がある。
• 企業は対応として合成データ(AIが生成したデータでAIを訓練する手法)や非公開データセットの囲い込みを進めているが、合成データには品質劣化(モデル崩壊)リスクが、囲い込みには独占や透明性低下の問題がある。
• 背景には、GPT-4やClaudeなど大規模言語モデル(LLM)の訓練がインターネット上の公開データ(Common Crawl、Reddit、Wikipedia、書籍など)に大きく依存してきた経緯がある。データが不足すればモデル改良のペースが鈍り、AI開発の構造的な制約になるという警告が業界内外で上がっている。