101條目

客製化晶片:即使NVIDIA稱霸,ASIC依然重要

客製化AI晶片——Google的TPU、Amazon的Trainium與Inferentia、Meta的MTIA、Microsoft的Maia,以及Broadcom和Marvell設計的一系列客戶專屬晶片——常被視為對NVIDIA的威脅。這種框架是錯誤的。客製化晶片並非贏者全拿的市場;它是針對特定工作負載的。NVIDIA之所以贏得訓練與通用推論市場,是因為CUDA與生態系鎖定效應。ASIC則在特定推論工作負載上取勝,前提是雲端巨頭能夠合理化其設計成本。這兩股趨勢同時成長,而Broadcom和Marvell無論哪家雲端巨頭勝出,都能從ASIC端收取設計費用。

由英文原文自動翻譯。 閱讀英文原文 →

客製化晶片的三方參與者

  • 自行設計的雲端巨頭:Google(TPU v5)、Amazon(Trainium 2、Inferentia 3)、Meta(MTIA v2)、Microsoft(Maia)。這些都是多年期計畫,設計支出高達數十億美元。
  • 客製化晶片代工廠:Broadcom(規模最大,客戶包括Google TPU)、Marvell(AWS等)。它們依據客戶規格設計並流片。
  • IP與設計工具:Arm、Cadence、Synopsys。每一顆客製化晶片都使用授權IP與設計軟體——無論哪顆晶片勝出,這些供應商都能獲得報酬。

為何ASIC適用於特定工作負載

一個24/7全天候大規模運行的工作負載——如搜尋排名、廣告推論、推薦系統——可以將5億美元($500M)的晶片設計成本分攤至數年的運作期間。ASIC在特定狹窄工作負載上,每瓦效能比GPU高出3至10倍。一旦雲端巨頭達到足夠的內部規模,自研晶片在純粹的投資回報率基礎上就變得具有成本正當性。這個算式很直接,且不依賴任何特定AI趨勢能否持續。

為何ASIC無法扼殺NVIDIA

訓練前沿模型需要CUDA加GPU所提供的通用可程式化能力。新的模型架構出現的速度,比ASIC設計週期能跟上的速度更快——2年的晶片設計週期對比6個月的架構轉變。CUDA生態系效應(開發者心佔率、程式庫成熟度、相容性)每年持續複利累積。運行混合工作負載的客戶——大多數企業都是如此——無法合理化ASIC設計成本;他們選擇購買GPU。「NVIDIA殺手」的框架之所以錯了十年,是因為它誤讀了市場結構。

資金流向何處

NVIDIA掌握訓練、通用推論,以及企業AI工作負載的長尾市場。雲端巨頭則在其內部大量推論業務上獲得成本節省。無論哪家雲端巨頭勝出,Broadcom和Marvell都能獲取設計服務收入。TSMC則從NVIDIA與ASIC生態系兩端都獲取晶圓產能份額。整體AI晶片市場的餅在擴大;只是切法不同。

投資意涵

槓鈴策略——同時做多NVIDIA以掌握訓練與通用市場,做多Broadcom/Marvell/Arm以掌握ASIC生態系——能同時捕捉這股趨勢的兩端。自2017年以來,僅憑ASIC威脅論而看空NVIDIA一直是虧損的交易。而忽視客製化晶片,則會錯過半導體產業中最清晰的設計服務成長故事之一。