LLMを効率的に提供する新コース — 低レイテンシかつ妥当なコストで多くの同時ユーザーにモデルを提供するには?
本コースでは、70Bパラメータモデルで約140GBものメモリを要するLLM推論の効率化を学びます。量子化によるメモリ削減、vLLMを用いたスマートなメモリ管理による同時リクエスト処理、そして速度・コスト・精度のトレードオフを評価するベンチマーク手法を習得できます。RedHat協力、Cedric Clyburn氏講師。
本コースでは、70Bパラメータモデルで約140GBものメモリを要するLLM推論の効率化を学びます。量子化によるメモリ削減、vLLMを用いたスマートなメモリ管理による同時リクエスト処理、そして速度・コスト・精度のトレードオフを評価するベンチマーク手法を習得できます。RedHat協力、Cedric Clyburn氏講師。