101条目

每瓦token数

每瓦token数是推理输出与耗电量之比——AI的收入线除以其最稀缺的投入。Token是超大规模云厂商出售的东西;瓦特则是它们无法迅速买到更多的东西。随着AI基建从建设阶段转向变现阶段,这一单一比率正在成为决定哪些运营商能从其已投入的基础设施中获得回报——以及硬件堆栈中哪些环节因承载算力而被重新定价——的关键指标。

由英文原文自动翻译。 阅读英文原文 →

它是什么

推理业务有自己的利润表:每生成一个token即为收入,每消耗一瓦即为成本。每瓦token数就是把两者相除。能提升该比率的超大规模云厂商,可以在基础设施成本不成比例上升的情况下增加收入——这正是该指标兼具利润率衡量功能的原因。其背后的杠杆是利用率:当加速器在等待内存时闲置——KV缓存,即推理的工作记忆,在推理和智能体(agentic)工作负载下从HBM中溢出——就会耗电却不产生token。让数据喂给更快,同样的功耗上限就能产出更多收入。

为何重要

电力已不再是充裕的投入要素。I/O Fund于2026年7月将这一指标推到聚光灯下,其数据显示ERCOT的并网排队容量超过438吉瓦(GW)——其中约390吉瓦为数据中心——而2024至2025年实际新增的容量仅约23吉瓦。每一代芯片对电网的抽取量都在增加:H100约为700瓦,Blackwell为1,200至1,400瓦,Rubin约为2,300瓦。廉价的能效杠杆已经用尽——超大规模云厂商的PUE在1.09至1.17之间,除了计算本身之外已无多少可挖掘的空间。内存墙使利用率问题变得结构性:截至2023年的二十年间,计算能力每两年增长约3倍,而内存带宽仅增长1.6倍,这一差距延续到Rubin一代——其推理计算能力是Blackwell的5倍,而HBM带宽仅为2.8倍、容量仅为1.5倍。由于HBM是与加速器打包出货的,购买更多内存就意味着购买更多未被充分利用的计算能力,HBM在加速器物料成本中的占比也从B200的约52%上升到Rubin的约62%——这正是内存超级周期背后的动力。

两种架构

工程上的解决方案是卸载引擎(offload engine):专用硬件负责从更廉价的内存层级持续为加速器供给KV缓存。目前正在形成两条路径。英伟达的专有方案CMX将BlueField-4 DPU与机架级SSD层级配合其Rubin平台——英伟达自己的数据称,在KV缓存相关工作中可实现最高5倍的token吞吐量和5倍的能效提升,而在将Vera Rubin机架与Groq 3 LPX机架配对、对比GB200 NVL72时,每兆瓦token数最高可提升35倍。开放路径则依托CXL——一种基于PCIe构建的、厂商中立的标准:Marvell的Structera控制器功耗约为30瓦,而增加CPU或GPU的功耗为150至700瓦,Marvell的数据显示在16TB池化层级上吞吐量提升达4.8倍。截至2025年初,三分之二的服务器已支持CXL;预计到2026年底这一比例将超过90%。值得注意的是,英伟达自家的Vera CPU也支持CXL 3.1——即便是专有阵营也为开放路径留了一道门。

如何解读

有三个观察信号。第一,关注超大规模云厂商财报电话会议的措辞:当管理层开始引用推理经济学——即token收入与电力的对比——这一指标就已成为记分牌。第二,关注机架级参数:每兆瓦token数如今已成为英伟达发布会上的核心数字,这意味着每一代平台都将以此被评判。第三,关注该比率的提升来自何处——芯片(新一代加速器)、架构(卸载引擎),还是选址(电力约束促使产能迁往有富余能源的地区)。不同的答案,会为堆栈中不同的环节重新定价。