101エントリー

推論エコノミクス:トレーニングから推論へのシフトが変えるすべて

AI業界は、トレーニング主導の段階(最大の支出が新モデルの学習に向かう)から、推論主導の段階(最大の支出がユーザー向けにモデルを大規模運用することに向かう)へと移行している。このシフトは半導体需要のプロファイルを根本的に変える。トレーニングは最大のコンピュートとメモリ帯域幅を持つ大規模GPUを好むのに対し、推論は効率性、ワットあたりのスループット、クエリあたりのコストを好む。トレーニング段階で勝った企業(NVIDIA)が、推論で支配的な地位を占める企業と同じではない可能性がある。カスタムASIC(Google TPU、AWS Trainium)、推論最適化アーキテクチャ(Groq、Cerebras)、エッジ推論チップ(Qualcomm、MediaTek)がいずれも重要性を高めている。

英語原文からの自動翻訳です。 英語の原文を読む →

トレーニング対推論:異なる経済性

トレーニングは固定費である。モデルを一度(または定期的に再学習)、大規模なGPUクラスターを使って学習させる。その経済性は生のコンピュート性能を優先する——最も多くのFLOPSを持つ者が勝つ。これはNVIDIAの領域であり、A100、H100、B200はすべてトレーニング・スループットに最適化されている。

推論は可変費である。ユーザーのクエリごと、APIコールごと、エージェントの行動ごとに推論コンピュートが必要となる。AIの採用が拡大するにつれて、推論量は指数関数的に増加する一方、トレーニングは比較的一定にとどまる。経済性は「最大のコンピュート」から「クエリあたりの最小コスト」と「ワットあたりの最大スループット」へと移行する。

この区別は投資家にとって非常に重要である。トレーニング主導の世界では、NVIDIAとNVIDIAのサプライチェーンを買う。推論主導の世界では、競争環境は分断化し、バリューチェーンが移行する。

推論シフトから利益を得るのは誰か

カスタムASICはシェアを拡大する。ハイパースケーラー(Google、Amazon、Microsoft)は、汎用GPUよりも自社の特定の推論ワークロードに最適化されたチップを、クエリあたり低コストで設計できるためだ。GoogleのTPU v5、AWS Trainium2、MetaのMTIAはいずれも推論に焦点を当てている。

NVIDIAは適応する。推論最適化構成(L40S、H100 NVL)を発表し、ソフトウェアの堀(TensorRT-LLM、Triton)を推し進めることで対応している。NVIDIAが推論を完全に失うことはないが、そのマーケットシェアはトレーニングにおけるものより低くなるだろう。

エッジ推論は、モデルがデバイス上で動作できるほど小型化するにつれて重要性を持つようになる。Qualcomm、MediaTek、Appleのカスタムシリコンは、クラウドではなくローカルでAIを実行することから利益を得る。

これがFunctional Indexにとって意味すること

Closelookは、Functional IndexのComputeレイヤーを通じてトレーニング対推論の比率を追跡している。推論が主導的になるにつれて、カスタムASICおよび推論重視企業のウェイトが、純粋なGPU関連企業に対して相対的に増加する。インデックスはこの構造的シフトを反映するように調整される。

主要企業

NVDA
NVIDIA
トレーニングで支配的、推論へ適応中
GOOG
Google (TPU)
カスタム推論ASIC — TPU v5
AMZN
Amazon (Trainium)
カスタム推論ASIC — Trainium2
QCOM
Qualcomm
エッジ推論 — オンデバイスAI