当大模型从“百模大战”走向“应用落地”,算力,这个被反复提及的数字底座,正在经历一场前所未有的供给侧变革,过去一年,国内AI算力规模持续扩张的态势不仅没有放缓,反而在政策与市场的双重驱动下,呈现出指数级的增长曲线,而这场扩张的底层逻辑,正从单纯的“堆卡时代”切换到“架构重构时代”——云厂商们不再满足于购买现成的服务器,而是开始加速布局新一代定制化、异构计算服务器,以此作为争夺AI时代话语权的核心武器。

国内AI算力规模的扩张,最直观的体现在于智算中心的遍地开花,从东部沿海的临港新片区到大西北的绿电基地,动辄千P、万P级的智算集群相继投产,规模扩张的背后,是传统通用服务器在推理效率、内存带宽和功耗控制上的捉襟见肘,当千亿参数模型成为常态,GPU利用率不足、跨节点通信延迟等问题被无限放大,这倒逼云厂商必须从“买设备”转向“造设备”,围绕大模型分布式训练和推理特征,重构服务器的硬件拓扑。
云厂商加速布局新一代服务器,其聚焦点正在“算、存、网”三个维度发生显著变化,在计算层面,液冷技术已从可选项变为标配,面对单卡功耗突破1000W的AI芯片,传统的风冷散热已逼近物理极限,新一代服务器普遍采用全液冷设计,通过冷板式或浸没式方案,将数据中心PUE降至1.1以下,这在电力成本敏感的当下,是商业竞争力的关键,在存储层面,HBM高带宽内存的容量不断翻倍,但更关键的是存储架构的“池化”——将内存、SSD资源从服务器内解耦,通过高速网络组成资源池,实现算力与存储的独立弹性伸缩,解决“内存墙”瓶颈,而在网络层面,800G高速交换技术开始规模商用于智算集群,配合IB或RoCEv2协议,构建超大规模无阻塞网络,确保万卡集群的并行效率不因通信开销而大打折扣。
更值得注意的是,云厂商的布局正在走向国产化与定制芯片的深度融合,为了规避供应链风险并降低成本,多家头部云厂商开始联合芯片厂商,针对自身算法负载定制ASIC芯片(如某些自研的AI加速卡),并同步定制专用服务器主板,实现软硬件协同优化,整机柜交付形态成为主流,服务器不再是独立个体,而是以整机柜为单位,包含供电、散热、交换、管理在内的“一体化算力单元”,出厂即部署,大幅缩短了从交付到上线的周期。
这种“新一代服务器”的加速渗透,带来的不仅仅是算力数字的增长,更是整个AI产业成本的下降,当单位算力成本因液冷和定制设计下降30%以上时,大量中小型AI企业才有机会以可承受的价格调用高质量算力,从而将精力集中于垂直模型的应用创新,可以说,国内AI算力的扩张已从“粗放建仓”转为“精细练功”,云厂商对新一代服务器的押注,既是响应大模型时代的必然之举,也是一场关乎未来十年技术底座的战略卡位,在这场没有硝烟的战争中,算力的物理形态正在被重塑,而AI的想象力,也被这冰冷的铁与硅重新定义。
版权声明
本文系作者授权妙妙经验网发表,未经许可,不得转载。
