本稿では、AMD MI355X GPU(CDNA4アーキテクチャ)における占有率(occupancy)の数学的基礎を第一原理から解説する。占有率はGPUの計算ユニットを効率的に活用するための重要な指標であり、本ガイドではその計算方法と最適化手法について詳述する。
#gpu
30 件
Slughornは、OpenGL、OSG、VulkanなどあらゆるGPU駆動グラフィックスAPI向けに設計された、MITライセンスのスラグフォント/グリフレンダリングライブラリ。GPUに依存せず、高品質なフォントグリフの描画を実現する。
FlashAttention-4は、非対称なハードウェアスケーリングに対応するため、アルゴリズムとカーネルパイプラインを協調設計した新しいアテンション機構である。従来の手法では難しかった、異種ハードウェア環境での効率的なメモリ管理と計算最適化を実現し、大規模モデルの推論および学習を高速化する。
本記事はNVIDIAのBlackwellアーキテクチャにおける行列乗算の実装と最適化について解説するシリーズの第1回目。GPUコンピューティングの基盤となる行列乗算が、Blackwellの新機能によってどのように高速化されるのか、その概要を紹介する。
本論文は、GPUアーキテクチャにおけるレイテンシ隠蔽のメカニズムを包括的に分析する。命令レベル並列性とスレッドレベル並列性の相互作用を調査し、メモリアクセスレイテンシを隠蔽するための warp スケジューリング手法の効果を評価する。実測データに基づき、様々なワークロードにおけるレイテンシ隠蔽の限界と最適化手法を明らかにする。
本記事はNVIDIAのBlackwellアーキテクチャにおける行列乗算の実装に関するシリーズの導入部です。Blackwell GPUのハードウェア機能を活用した高性能な行列計算手法の基礎を解説し、深層学習や科学計算における最適化への応用を展望します。
FlashAttention-4は、非対称ハードウェアスケーリングに対応するため、アテンションアルゴリズムとカーネルパイプライニングを協調設計した新手法である。メモリアクセスパターンと計算スケジューリングを最適化することで、異種ハードウェア環境におけるTransformerモデルの推論・学習効率を大幅に向上させる。
Runwayは、推論タスクに使用されているGPUがアイドル状態になる夜間などの時間帯を活用し、それらを研究目的に再利用する「Borrowing the Night」アプローチを導入。これにより、追加のハードウェア投資なしで計算資源を最大限に活用し、AI研究の効率を向上させる。
UATCは、GPUのメモリ不足(OOM)を防止するための閉ループ制御システムです。GPUメモリ使用量をリアルタイムで監視し、閾値を超えた場合に自動的にプロセスを一時停止・再開することで、安定したGPU動作を実現します。このツールは、大規模な機械学習モデルのトレーニングや推論を行う際のメモリ管理に役立ちます。
大規模言語モデル(LLM)のシェーダー記述能力を評価するためのベンチマークツール。GPUシェーディング言語(GLSLやHLSLなど)を用いたコード生成タスクを通じて、モデルのグラフィックスプログラミング性能を測定する。
本記事は、暗号通貨マイナーの視点からNvidiaの事業戦略とGPU市場における同社の立ち位置を分析する。マイニング需要とゲーマー需要のバランス、GPU供給への影響、そしてNvidiaの製品ラインナップや価格設定がマイナーにどのような影響を与えているかを考察する。
Wgpu v30
3.0Wgpu v30 has been released. This version includes new features, improvements, and bug fixes for the cross-platform graphics abstraction layer written in Rust, providing better WebGPU support and enhanced performance.
Cerebrium社は、GPUメモリスナップショット技術を用いて、CUDAワークロードのコールドスタート時間を数秒に短縮する手法を紹介。従来の長時間を要するコンテナ起動を大幅に改善し、オンデマンドのGPU推論やトレーニングをより効率的に実行可能にする。
Bargo has launched a "Compute Tightness Index" that measures real-time GPU supply-demand balance. The index tracks availability across major cloud providers and indicates when compute resources are scarce or abundant. It helps AI teams optimize their cloud spending and capacity planning decisions.
Nvidiaは、急増するRAM需要がテクノロジー製品の価格に影響を与える中、RTX 3060などの旧型グラフィックカードの生産を再開した。新たなAI需要やメモリ市場の逼迫により、GPU価格が高騰している状況への対応策として、同社は既存の設計を活用したコスト効率の良いソリューションを提供している。
本記事では、AMD GPU上で大規模言語モデル(LLM)の推論を高速化するために、低レイテンシGEMM(一般行列積)を活用する手法について解説する。特に、推論時のボトルネックとなりやすい行列演算を最適化し、応答時間の短縮を実現する具体的なアプローチを紹介する。
2025年時点のLinuxグラフィックスタック(Wayland、X11、DRM、GPUドライバなど)の内部動作を詳細に調査した記事。著者は自身のグラフィックプログラムの移植を通じて、現代のLinuxにおける画面描画の仕組みを一から解説している。
UATC(Universal Automatic Throttling Controller)は、LLM学習中のGPUメモリ不足(OOM)を防ぐためのクローズドループ制御システムです。リアルタイムでGPUメモリ使用量を監視し、動的にスロットリングを行うことで、OOMエラーを未然に防止します。このツールは、大規模言語モデルの学習を安定化させ、利用可能なGPUリソースを最大限に活用することを可能にします。
Zluda 6がリリースされた。これは、Nvidia GPU向けに書かれたCUDAアプリケーションを修正なしで、AMDやIntelなどの非Nvidia GPU上で実行できるようにする互換レイヤーである。本バージョンでは、パフォーマンスの改善や対応GPUの拡充が図られている。
TurboPrefillは、Llama-3-70Bモデルにおいてllama.cppのパイプラインパラレル方式と比較して最大2.7倍の高速化を実現する新たな推論最適化手法です。本PRではその実装とベンチマーク結果が公開されています。
ビニング(Binning)とは、半導体製造工程において、同じウェハーから製造された個々のチップを、その性能や特性に基づいて異なるグレード(「ビン」)に分類するプロセスです。CPUやGPUの製造では、すべてのチップが同じ性能を発揮するわけではないため、動作クロック速度や消費電力、歩留まりに応じて選別され、異なる製品モデルとして販売されます。
GPUバブルの崩壊
5.0Moondream社のブログ記事「Popping the GPU Bubble」では、GPU需要の異常な高騰とAI業界を取り巻く「バブル」について考察している。著者は、現在のGPU不足は一時的なものであり、AIモデルの効率化や代替ハードウェアの登場によってバブルは崩壊すると主張。長期的にはGPU価格の正常化とアクセスの民主化が進むと予測する。
This article explores how to run WebGL rendering without a physical GPU by using software-based graphics processing. It discusses the technical challenges, performance implications, and practical use cases for GPU-less WebGL environments, such as server-side rendering and CI/CD testing pipelines.
本記事では、GPUカーネルがCPU上から呼び出されてからGPU上で実際に実行されるまでの一連の流れを詳しく解説する。CUDAランタイムによるメモリ管理、カーネルの起動、スケジューリング、そして並列スレッド実行に至るまで、低レベルの仕組みを理解できる内容となっている。GPUプログラミングの内部動作に興味がある開発者に最適な技術解説である。
本レポートでは、2026年における主要GPUの価格動向を分析。市場の需給バランス、新製品投入の影響、クラウドプロバイダー別の料金比較など、GPUコストに影響を与える要因を包括的にまとめる。
近年、ハイエンドGPUの電源コネクタが過熱・溶融する事例が相次ぎ、深刻な問題となっています。本記事では、この現象の原因やリスクを解説し、コネクタの完全挿入確認やケーブル管理体制の徹底など、安全にシステムを運用するための具体的な予防策を紹介します。
Nvidiaの次世代アーキテクチャ「Feynman」について、2026年時点で判明している情報をまとめたRedditの議論。後継となるRubinアーキテクチャの詳細や、GPU業界への影響についてコミュニティで活発に意見交換が行われている。
McNUFFTは、Apple Silicon搭載のGPU上で非一様高速フーリエ変換(NUFFT)を実現するライブラリです。MLXフレームワークを活用することで、GPUアクセラレーションによる高速な計算が可能で、MRI再構成や天文学など、非一様サンプリングデータの処理が必要な分野での応用が期待されます。
MacBook上でLLM(大規模言語モデル)を動かしているユーザーに向けて、専用GPUとの違いや、MacBookがどの程度のモデルを実行できるかを判断する方法を尋ねる質問。ユニファイドメモリを活かしたMacBookの特性と、専用GPU搭載マシンとの性能差を比較したいという内容。
GPUのVRAM(ビデオメモリ)をゴーストのように占有し、明示的に解放されるまでメモリを占有し続ける未使用テンソル(「ゴーストテンソル」)の問題と、それを特定して閉じる(close())方法について解説。Pythonのコンテキストマネージャの活用や参照管理のベストプラクティスを通じて、VRAMリークを防止する実践的テクニックを紹介する。