在聊产业链之前,我们得先搞清楚一个问题:为什么AI时代算力突然成了"香饽饽"?
答案其实很简单:大模型是"吃"算力长大的。训练一个大语言模型,需要海量的数据和庞大的计算资源。GPT-3的训练用了约355个GPU年(也就是一块GPU跑355年),参数达到1750亿。而到了GPT-4级别,外界估算其训练算力可能是GPT-3的10倍以上。随着模型越来越大、能力越来越强,对算力的需求也在呈指数级增长。
这就好比工业革命时期,蒸汽机的发明让煤炭成了核心资源一样。AI革命的到来,让算力成了最核心的基础设施。谁拥有更多的算力,谁就能训练出更强的模型,谁就能在AI竞争中占据有利位置。
从全球范围来看,各大科技公司都在疯狂"囤"算力。微软、谷歌、Meta、亚马逊……这些巨头每年在数据中心上的投入都是数百亿甚至上千亿美元。国内的字节、阿里、腾讯、百度也不遑多让,纷纷加码算力基础设施。这种级别的投入,放在以前是不可想象的。
更重要的是,算力需求的增长不是一次性的,而是持续性的。一方面,模型参数量还在不断膨胀,训练阶段需要的算力越来越大;另一方面,推理阶段(也就是用户实际使用AI的过程)消耗的算力更加惊人。当AI应用越来越普及,数亿用户每天和大模型对话、生成图片和视频,背后需要的推理算力是一个天文数字。
很多人一提到算力,第一反应就是GPU。其实GPU只是算力产业链中的一环,整条产业链非常长,涉及的环节众多。我们可以把它大致分为三层:上游的核心硬件、中游的算力基础设施、下游的算力应用与服务。
这一层是算力的基础,没有硬件就没有算力。主要包括以下几类:
(1)计算芯片:算力的"大脑"
这是算力最核心的部分,主要包括GPU、AI加速芯片、CPU等。其中GPU是目前AI训练和推理的主力军。
GPU,也就是图形处理器,原本是用来打游戏、做图形渲染的。后来人们发现,GPU的并行计算能力特别适合AI训练——因为AI的神经网络计算本质上就是大量的矩阵运算,正好和GPU的架构匹配。于是GPU"跨界"成了AI算力的核心。
说到GPU,就不得不提英伟达。这家公司几乎垄断了全球AI训练芯片市场,其H100、H200等产品是各大科技公司的"必争之物"。为什么英伟达这么强?一方面是硬件性能确实领先,另一方面更重要的是它的CUDA生态——一套完整的软件工具链,让开发者可以方便地用英伟达的GPU做AI开发。这种软硬件结合的优势,是其他厂商短期内很难追赶的。
除了GPU,还有专门针对AI设计的加速芯片,比如谷歌的TPU、国内的各类AI芯片等。这些芯片在特定场景下可能比GPU效率更高,但生态和通用性目前还比不上GPU。
(2)存储芯片:算力的"记忆"
光有计算能力还不够,还得有足够快、足够大的存储来配合。AI训练过程中,数据需要在计算单元和存储之间频繁移动,如果存储速度跟不上,GPU再快也没用——这就是所谓的"存储墙"问题。
HBM(高带宽内存)就是为了解决这个问题而生的。和普通的DDR内存不同,HBM是把内存芯片堆叠起来,通过硅通孔(TSV)技术连接,带宽比传统内存高好几倍。目前HBM已经成了高端AI芯片的"标配",没有HBM的GPU,算力会大打折扣。
除了HBM,还有DDR内存、NAND闪存等也很重要。数据中心需要大量的存储设备来存放训练数据和模型参数。
(3)光模块/光芯片:算力的"血管"
AI训练不是用一块GPU就能搞定的,而是成千上万块GPU组成一个大集群。这些GPU之间需要高速通信,否则就会出现"一个人干活、其他人等着"的情况。光模块就是实现高速数据传输的关键设备。
光模块的作用是把电信号转换成光信号,通过光纤进行远距离高速传输。从100G到400G再到800G,光模块的速率在不断提升。现在1.6T的光模块也已经开始商用了。
为什么光模块这么重要?因为在大模型训练中,GPU之间的通信开销可能占到总时间的30%甚至更多。如果光模块速度跟不上,整个集群的效率就会大幅下降。这也是为什么AI越发展,光模块越重要的原因。
(4)散热/电源:算力的"空调"
GPU的功耗非常惊人。一块H100的功耗约700瓦,下一代产品可能更高。一个机柜如果装上十几块GPU,功耗就能达到十几千瓦。这么大的功耗会产生大量的热量,如果散热不好,芯片就会降频甚至损坏。
传统的风冷散热已经逐渐不够用了,液冷技术开始成为主流。液冷就是用液体(比如绝缘冷却液)来带走热量,效率比风冷高很多。液冷又分冷板式、浸没式等不同路线,目前冷板式应用更广泛一些。
还有电源相关的设备,比如UPS、变压器、PDU等等。数据中心的电力供应是个大工程,据统计,一个大型数据中心的用电量可能相当于一个中等城市的用电量。
有了硬件之后,还需要把它们组装起来,变成可以使用的算力。这一层主要包括:
(1)服务器厂商:组装"算力机器"
服务器厂商负责把GPU、CPU、内存、硬盘、网卡等零部件组装成一台完整的AI服务器。你可以把它们理解成"电脑组装厂",只不过组装的是价值几十万甚至上百万的高端服务器。
AI服务器和普通服务器最大的区别,就是搭载了多块高端GPU。比如一台标准的AI服务器可能装8块GPU,通过NVLink或者其他高速互联技术连接在一起。
全球AI服务器市场主要由几家大厂占据,国内的浪潮信息、紫光股份、中科曙光等都有较强的实力。
(2)IDC/数据中心:算力的"厂房"
服务器需要放在数据中心里运行。数据中心不仅要提供场地,还要提供电力、散热、网络带宽等基础条件。好的数据中心需要靠近能源基地(电费便宜)、气候凉爽(散热成本低)、网络基础设施完善。
AI时代对数据中心的要求比以前更高了。普通的数据中心可能一个机柜只有几千瓦的电力容量,而AI数据中心需要单柜十几千瓦甚至几十千瓦。这对电力供应和散热系统都是巨大的挑战。
国内有很多IDC厂商,比如万国数据、世纪互联、数据港等等。另外,三大运营商也有大量的数据中心资源。
(3)云计算厂商:算力的"供电局"
不是每家公司都有能力自己建数据中心、买服务器。大多数中小企业甚至一些大公司,都是通过云服务来获取算力的。云计算厂商把自己的算力资源打包成服务,用户按需付费使用,就像用电一样方便。
全球云计算市场主要是亚马逊AWS、微软Azure、谷歌云这"三巨头"。国内则是阿里云、腾讯云、华为云、百度智能云等厂商在竞争。
云计算是算力的重要"变现"渠道,也是AI应用发展的重要推手。有了云算力,创业公司不需要投入巨资买硬件,就能开展AI业务,大大降低了AI创业的门槛。
算力最终是要被用掉的。下游的应用层是算力的最终"消费者",主要包括:
(1)大模型公司:算力的最大买家
OpenAI、Anthropic、国内的各种大模型公司,是算力的最大购买者。训练一个大模型可能需要几万甚至几十万块GPU,花费数亿甚至数十亿美元。这些公司要么自己建算力集群,要么向云厂商租用算力。
(2)行业应用:把AI用起来
除了大模型公司,越来越多的传统行业也在拥抱AI。金融、医疗、教育、制造、零售……几乎每个行业都在探索AI的应用场景。这些应用不一定需要训练大模型,但推理算力的消耗非常大。
比如,一家金融公司用AI做风控,每天要处理大量的交易数据,背后就需要大量的推理算力。一家医院用AI做医学影像分析,也需要算力支撑。随着AI应用越来越普及,推理算力的需求可能会超过训练算力。
(3)普通用户:最终的算力受益者
我们每个人都是算力的最终受益者。用AI聊天、生成图片、做翻译、写代码……这些看似免费的服务背后,都是真金白银的算力成本。当你用AI工具的时候,你其实是在"消耗"算力。
刚才我们把产业链大致过了一遍,接下来挑几个最受关注的环节深入聊聊。
GPU毫无疑问是算力产业链中最核心、最受关注的环节。我们来详细说说。
为什么GPU这么贵还供不应求?
一块高端AI GPU的价格可能达到几万甚至十几万元人民币,而且还经常买不到。为什么会这样?主要有几个原因:
第一,技术壁垒极高。GPU的设计和制造难度非常大,全球能做高端AI GPU的厂商屈指可数。英伟达之所以能垄断市场,靠的是多年的技术积累和生态优势。
第二,产能有限。高端GPU需要用最先进的制程工艺(比如台积电的4nm、3nm)来制造,而先进制程的产能本身就很紧张。再加上AI需求爆发,供需矛盾就更加突出了。
第三,生态护城河。英伟达不只是卖硬件,更重要的是它的CUDA软件生态。全球的AI开发者几乎都在使用CUDA,这种软件生态的粘性非常强。其他厂商即使做出了性能相当的硬件,没有软件生态的支持,也很难被市场接受。
国内GPU厂商的机会在哪里?
很多人关心国产GPU能不能追上来。客观来说,和英伟达的差距确实存在,而且还不小——不仅是硬件性能的差距,更重要的是软件生态的差距。
但这并不意味着没有机会。首先,国内有庞大的市场需求,而且出于安全可控的考虑,很多国内客户愿意给国产厂商机会。其次,国内厂商可以从特定场景切入,比如推理、训练的细分领域,逐步积累技术和生态。最后,AI的发展还在早期,未来的技术路线可能会发生变化,比如专用AI芯片、存算一体、光子计算等等,新的技术路线可能带来"换道超车"的机会。
光模块是算力产业链中另一个非常重要的环节,也是近期市场关注度很高的方向。
为什么AI时代光模块升级这么快?
在传统的数据中心里,服务器之间的通信量相对有限,光模块的升级节奏比较平稳。但AI时代完全不一样了。大模型训练需要成千上万块GPU协同工作,GPU之间要频繁地交换数据。这些数据通过交换机、光模块在数据中心内部传输,如果传输速度不够快,GPU就得等着,整个训练效率就会大幅下降。
举个简单的例子:假设有10000块GPU一起训练模型,如果每块GPU的计算时间是100,但通信时间要50,那整个集群的效率就被通信拖慢了三分之一。如果把光模块的速度提高一倍,通信时间降到25,整体训练时间就能缩短很多。
所以,AI越发展,对光模块的速率要求就越高。从100G到400G再到800G,再到现在的1.6T,光模块的升级速度在不断加快。
光模块的产业链格局
全球光模块市场,中国厂商占据了非常重要的地位。根据行业数据,全球前十大光模块厂商中,有好几家都是中国公司。中际旭创、新易盛、天孚通信、光迅科技……这些国内厂商在全球市场都有很强的竞争力。
光模块的上游是光芯片。光芯片是光模块中最核心的部件,技术含量也最高。高端光芯片目前还是海外厂商(比如博通、英伟达的Mellanox等)占据主导,但国内厂商也在逐步追赶。
HBM(高带宽内存)可能是很多人不太熟悉,但其实非常关键的一个环节。
前面我们提到了"存储墙"的概念——GPU的算力增长很快,但内存的带宽增长跟不上,导致GPU"喂不饱",算力发挥不出来。HBM就是用来解决这个问题的。
HBM的原理说起来也不复杂:把多块内存芯片像叠罗汉一样叠起来,通过硅通孔(TSV)技术垂直连接。这样做的好处是,既增加了容量,又大幅提高了带宽——因为数据可以在垂直方向上传输,路径更短、速度更快。
目前HBM已经发展到了第三代、第四代。HBM3的带宽已经达到了每秒数TB,是传统DDR5内存的好几倍。下一代HBM4的性能还会更高。
为什么说HBM重要?因为现在高端AI芯片的性能,很大程度上受限于内存带宽。没有HBM,GPU的算力再强也没用。而且HBM的产能也很紧张——全球能做HBM的厂商很少,主要是三星、海力士、美光这几家。这也导致HBM的价格居高不下。
了解了产业链之后,我们再来看看这个行业未来的发展方向和面临的挑战。
趋势一:算力需求持续指数级增长
这可能是最确定的一个趋势。随着AI技术的不断进步,模型越来越大、应用越来越多,对算力的需求只会越来越大。有研究机构预测,未来几年AI算力需求可能保持每年10倍以上的增长速度。这个速度是非常惊人的。
趋势二:算力芯片多元化
虽然现在GPU是主流,但未来的算力芯片可能会更加多元化。专用AI芯片(ASIC)、存算一体芯片、光子芯片、量子芯片……各种新技术路线都在探索中。不同的场景可能需要不同的芯片,不会是"一种芯片打天下"的局面。
趋势三:算力网络的兴起
现在的算力大多是集中式的——一个大的数据中心里集中了几十万块GPU。但未来可能会出现"算力网络",也就是把分散在各地的算力资源连接起来,像电网一样统一调度。用户需要算力的时候,就近获取,就像用电一样方便。
国内已经在推进"东数西算"工程,本质上就是在构建全国性的算力网络。把东部的数据拿到西部去计算,利用西部丰富的能源和较低的成本。
趋势四:推理算力占比提升
目前大家关注比较多的是训练算力,也就是训练大模型需要的算力。但随着AI应用的普及,推理算力的需求增长可能会更快。毕竟,训练一个模型只需要一次,而使用这个模型可能有亿万次。未来推理算力占总算力的比例可能会超过训练算力。
趋势五:国产替代加速
出于安全可控的考虑,国产算力的发展是必然趋势。从芯片到服务器再到软件生态,国内厂商都在加速布局。虽然目前和国际先进水平还有差距,但这个方向是确定的,只是时间问题。
挑战一:能耗问题
算力的发展离不开电力。一个大型AI数据中心的用电量可能相当于一个小城市。随着算力需求的增长,电力供应会不会成为瓶颈?这是一个很现实的问题。
而且,大量的电力消耗还会带来碳排放的问题。在"双碳"目标下,怎么在发展算力的同时控制碳排放,是整个行业需要面对的课题。
挑战二:散热问题
功耗越高,散热越难。高端AI芯片的功耗已经达到了几百瓦甚至上千瓦,传统的风冷已经不够用了。液冷虽然效率更高,但成本也更高,而且还有漏水风险等技术问题。
未来可能还会出现更多新型散热技术,比如浸没式液冷、两相冷却、芯片级散热等等。散热技术的进步,也是推动算力发展的重要因素。
挑战三:供给瓶颈
算力的供给不是说想增加就能增加的。从芯片的设计、制造,到数据中心的建设,都需要时间。而且先进制程的芯片产能本身就很有限。如果需求增长太快,供给跟不上,就会出现"算力荒"。
最后,我们来聊聊一个更贴近生活的话题:算力浪潮和普通人有什么关系?我们应该怎么看待这件事?
可能你觉得"算力"这个词离自己很远,但其实它已经渗透到了生活的方方面面。你用的AI聊天机器人、拍照的AI美颜、短视频平台的推荐算法、导航的路径规划……背后都有算力在支撑。
未来,AI会越来越普及,算力会像水电一样,成为我们生活中不可或缺的基础设施。你可能感觉不到它的存在,但它无处不在。
很多人谈论AI,只关注模型本身——什么参数多大、能力多强。但实际上,AI的发展是建立在算力进步的基础上的。没有算力的提升,再先进的算法也只能停留在论文里。
理解了算力,你才能更深刻地理解为什么AI这几年突然爆发,为什么大模型越来越强,为什么AI会是一个长期的趋势。
算力是个好东西,但并不是沾上"算力"两个字就一定靠谱。市场上有很多概念炒作,什么公司都想往AI、算力上靠。作为普通人,我们要保持理性,学会分辨哪些是真的有技术、有产品,哪些只是在讲故事。