这两年,算力中心、智算中心、数据中心越来越火。
很多人一提到算力中心,第一反应就是GPU、服务器。
但真正建一个算力中心,远没有“买一批GPU服务器”这么简单。
一个完整的算力中心,本质上是一套庞大的基础设施系统。既要解决“算”的问题,还要解决数据怎么存、设备怎么连接、电从哪里来、热量怎么散出去。
算力中心最核心的当然是服务器。 根据不同用途,会配置CPU服务器、GPU服务器、AI训练服务器、推理服务器,以及NPU、ASIC等专用计算设备。 但算力越强,耗电越大、发热越严重。所以今天讨论算力中心,已经不能只看芯片了。
AI训练需要处理海量数据,所以算力中心必须配套大规模存储系统。
主要包括SSD、机械硬盘、分布式存储、对象存储、高性能存储和备份系统等。
如果GPU计算速度很快,但数据读取速度跟不上,GPU就只能“等数据”。所以AI算力中心的存储,不仅要容量大,更要速度快。
单台服务器自己计算并不难,真正难的是让几百台、几千台服务器协同计算。 因此算力中心需要大量交换机、路由器、网卡、光模块、光纤等高速网络设备。 这也是为什么AI算力快速发展之后,高速交换机和高速光模块成为重要产业链。 服务器需要24小时连续运行,而且不能轻易停电,因此算力中心必须配套完整的供配电系统。 大型算力中心的用电规模,可能达到几十兆瓦甚至更高。 所以现在很多算力项目能不能落地,除了看有没有GPU,还要看当地有没有足够的电力资源和电网接入能力。
UPS · PDU · 蓄电池 · 柴油发电机
GPU和服务器运行时会产生大量热量。
过去普通数据中心主要依靠空调和风冷,但随着AI服务器功率越来越高,单个机柜的功率密度不断上升,传统风冷已经越来越吃力。
因此现在越来越多AI算力中心开始采用冷板液冷、浸没式液冷,以及冷冻水、CDU等配套设备。
原因很简单:热量带不走,再强的GPU也无法稳定运行。
除了核心设备,一个算力中心还需要机柜、综合布线、消防、门禁、视频监控、防雷接地等基础设施。 同时,还要通过DCIM等管理系统,对服务器、电力、温度、湿度、制冷设备等进行实时监控。 因为大型算力中心可能拥有成千上万台设备,仅靠人工巡检根本无法完成日常运维。 如果把一个算力中心完整拆开,会发现它背后的产业链非常长。 特别是在AI时代,随着单机柜功率不断提升,算力中心正在发生一个非常明显的变化:
“电力和散热决定算力中心能建多大”
最后简单总结
服务器负责算
存储负责存