咨询QQ:
      杂志订阅

      编辑

      网管

      培训班

      市场部

      发行部

电话服务:
 010-82024981
设为首页 | 收藏本页
大规模人工智能工作负载如何改变数据中心基础设施
  • 在传统数据中心中,服务器、交换机、存储设备、电源和制冷系统往往可以相对独立地进行规划。但在大规模人工智能工作负载下,加速器之间需要持续交换大量数据,计算资源的利用率又高度依赖网络通信、数据供给、电力供应和散热能力。任何一个环节出现瓶颈,都可能限制整个集群的有效性能。
  • 随着人工智能训练、推理和数据处理任务不断扩大,数据中心正在从以单台服务器为核心的基础设施模式,转向面向机架、集群乃至整个设施的系统级设计。
      
      在传统数据中心中,服务器、交换机、存储设备、电源和制冷系统往往可以相对独立地进行规划。但在大规模人工智能工作负载下,加速器之间需要持续交换大量数据,计算资源的利用率又高度依赖网络通信、数据供给、电力供应和散热能力。任何一个环节出现瓶颈,都可能限制整个集群的有效性能。
      
      因此,衡量人工智能基础设施的能力不能只关注处理器、GPU、网卡或交换机的峰值参数,还需要关注数据传输效率、资源利用率、扩展效率、功率密度、散热能力以及实际工作负载下的持续运行表现。
      
      这一变化正在重新定义数据中心的设计方法:基础设施不再只是承载计算设备的物理环境,而逐渐成为决定人工智能工作负载效率的重要组成部分。
      
      大规模人工智能工作负载如何改变数据中心基础设施
      
      从服务器级部署转向机架级和集群级设计
      
      分布式人工智能训练通常需要多个加速器同时处理任务,并通过高速网络持续交换参数、梯度和中间数据。大规模推理同样需要多个计算节点协同完成请求处理。
      
      这意味着,单台服务器的性能已经不足以代表整个系统的性能。
      
      当服务器数量增加以后,网络拓扑、交换容量、存储访问、电源分配和冷却能力之间会产生更加明显的耦合关系。一个计算节点性能再高,如果网络无法提供足够的通信能力,或者存储无法及时提供数据,其计算资源就难以得到充分利用。
      
      因此,人工智能基础设施的设计单位正在逐渐从服务器转向高密度机架和多机架集群。
      
      以NVIDIAGB300NVL72这类机架级系统为例,其设计思路并不是简单地将大量GPU安装到同一机架,而是将计算、网络、供电和液冷等多个子系统作为一个整体进行规划。多个机架级单元还可以通过计算网络、存储网络和管理网络进一步连接,从而构建更大规模的计算集群。
      
      这种模式意味着,数据中心在规划人工智能基础设施时,需要同时回答几个问题:
      
      ·一个机架可以部署多少计算资源?
      
      ·每个机架需要多少电力容量?
      
      ·如何将产生的热量持续带走?
      
      ·多个机架之间需要怎样的网络拓扑?
      
      ·光纤和高速互连如何进行布线?
      
      ·存储系统能否持续提供足够的数据吞吐?
      
      ·集群规模扩大后,网络和电力系统是否仍有扩展空间?
      
      ·如何在实际工作负载下验证整个系统的性能?
      
      这些问题已经超出了单个服务器的设计范围。
      
      人工智能基础设施的核心变化
      
      1.网络从连接组件变成计算系统的一部分
      
      人工智能工作负载通常具有较强的东西向流量特征。大量计算节点需要频繁进行数据交换,通信性能会直接影响训练同步、参数传输以及分布式任务的执行效率。
      
      因此,网络设计不能只看交换机端口速率。
      
      随着集群规模扩大,还需要综合考虑:
      
      ·网络拓扑结构;
      
      ·端口密度;
      
      ·链路利用率;
      
      ·网络收敛能力;
      
      ·拥塞控制;
      
      ·超额订阅;
      
      ·光模块与光纤链路;
      
      ·线缆长度和物理路径;
      
      ·网卡性能;
      
      ·网络协议和软件配置。
      
      例如,一条高速链路能够提供较高的理论带宽,但如果交换节点之间存在拥塞,或者通信路径设计不合理,应用层实际获得的吞吐量仍然可能明显低于理论值。
      
      这也是为什么人工智能集群的网络评估需要从“端口速度”进一步转向“应用通信效率”。
      
      2.存储系统需要匹配计算资源的数据需求
      
      人工智能工作负载不仅需要大量计算能力,也需要持续的数据供应。
      
      训练数据通常需要经过读取、预处理、传输和加载后才能进入计算节点。如果存储系统、文件系统、网络或者内存子系统无法提供足够的数据吞吐,计算加速器就可能处于等待状态。
      
      因此,存储性能不能只通过单个SSD的读写速度进行判断。
      
      更合理的评估方式是分析完整的数据路径,包括:
      
      数据源→存储系统→存储网络→内存→加速器→计算结果→存储系统
      
      在这一链路中,任何一个环节都可能成为瓶颈。
      
      此外,检查点保存、任务恢复、中间数据处理以及数据集预取也会产生大量I/O需求。随着集群规模扩大,存储架构需要与计算节点数量和工作负载特征保持匹配。
      
      3.电力系统开始成为扩展能力的重要约束
      
      高密度人工智能机架通常需要比传统服务器机架更高的功率密度。
      
      这会影响数据中心的多个基础设施层面,包括:
      
      ·配电容量;
      
      ·机架PDU配置;
      
      ·UPS容量;
      
      ·备用电源;
      
      ·母线系统;
      
      ·配电路径;
      
      ·变压器容量;
      
      ·机房供电冗余;
      
      ·机架功率监测。
      
      对于传统IT机房而言,增加服务器通常意味着逐步增加机架数量;而对于高密度人工智能部署而言,在有限空间内增加更多计算资源可能首先受到电力容量限制。
      
      因此,机房能够容纳多少机架,并不意味着它能够支持同等数量的高密度人工智能机架。
      
      电力规划需要与机架布局、计算资源数量和未来扩展计划同步进行。
      
      4.液冷逐渐成为高密度部署的重要组成部分
      
      计算密度提升会带来更高的热流密度。传统风冷系统在部分部署场景下仍然可以使用,但当单机架功率持续提高时,单纯依靠空气循环带走热量会面临越来越大的压力。
      
      液冷因此成为高密度计算环境的重要技术路径之一。
      
      液冷系统的设计并不仅仅是安装冷却设备,还涉及:
      
      ·冷却液分配;
      
      ·冷却回路;
      
      ·CDU;
      
      ·管路设计;
      
      ·快速接头;
      
      ·漏液检测;
      
      ·热交换能力;
      
      ·机架布局;
      
      ·维护空间;
      
      ·冷却系统冗余。
      
      更重要的是,液冷必须与服务器、机架、电源和设施侧基础设施共同规划。
      
      如果计算设备已经部署完成后才考虑冷却升级,往往会增加改造难度和部署成本。因此,高密度人工智能机房越来越需要在建设初期就确定适配的冷却架构。
      
      峰值性能并不等于实际工作负载性能
      
      人工智能基础设施评估中,一个容易被忽视的问题是:硬件规格与应用性能之间并不是简单的线性关系。
      
      例如,GPU数量增加一倍,并不意味着训练速度一定提高一倍。
      
      实际性能还受到通信、同步、数据加载、调度和系统开销影响。
      
      数据路径效率决定计算资源利用率
      
      如果数据无法及时送达加速器,即使计算设备拥有较高的理论性能,也无法持续保持高利用率。
      
      因此,评估计算系统时,需要关注:
      
      ·加速器利用率;
      
      ·内存带宽;
      
      ·存储吞吐;
      
      ·数据预取能力;
      
      ·数据预处理效率;
      
      ·输入流水线;
      
      ·检查点性能。
      
      这些指标共同决定计算资源能否持续获得足够的数据。
      
      通信效率影响分布式计算扩展
      
      在多节点环境中,通信开销会随着规模扩大而变得更加明显。
      
      当更多计算节点参与同一任务时,同步、参数交换和集合通信可能占据更高比例的执行时间。
      
      因此,需要关注:
      
      计算时间+通信时间+同步时间+I/O时间+调度开销
      
      而不是单独观察GPU或网络设备的峰值参数。
      
      集群规模越大,扩展效率越重要
      
      增加计算资源可以提高总体处理能力,但扩展效率通常会受到通信和协调开销影响。
      
      如果一个系统增加大量GPU后,工作负载完成时间只得到有限改善,那么新增硬件的投资回报就可能受到影响。
      
      因此,大规模人工智能基础设施应该同时关注:
      
      ·峰值计算能力;
      
      ·有效吞吐量;
      
      ·加速器利用率;
      
      ·扩展效率;
      
      ·单位功耗性能;
      
      ·作业完成时间;
      
      ·单位计算成本。
      
      这种评价方法比单纯比较硬件参数更接近真实运行环境。
      
      大规模扩展面临的主要基础设施挑战
      
      网络扩展复杂度提高
      
      从一个机架扩展到多个机架后,网络规划会变得更加复杂。
      
      除了交换容量,还需要考虑机架间链路数量、光纤距离、布线路径、交换设备位置以及网络冗余。
      
      当集群规模扩大后,原本适合小规模部署的网络结构可能不再适用。
      
      因此,网络设计应尽量预留未来扩展空间,包括端口、光纤、机架位置和交换容量等。
      
      物理空间不再是唯一限制
      
      传统数据中心通常根据机架数量计算空间需求。
      
      但对于高密度人工智能基础设施而言,更重要的问题是:
      
      空间是否同时具备足够的电力、冷却和网络条件。
      
      一个空置机架位置,如果没有足够的配电能力和冷却能力,就无法直接转化为可用的人工智能计算容量。
      
      因此,数据中心的“可用空间”正在从面积概念转向综合基础设施容量概念。
      
      建设周期影响计算资源上线速度
      
      人工智能基础设施的部署通常涉及服务器、GPU、交换机、光模块、线缆、机架、电源和冷却系统等多个环节。
      
      即使计算设备已经到位,只要电力、冷却、网络或布线尚未准备完成,整个集群仍然无法投入运行。
      
      因此,项目周期需要覆盖:
      
      ·需求规划;
      
      ·设施评估;
      
      ·设备采购;
      
      ·电力准备;
      
      ·冷却系统建设;
      
      ·机架安装;
      
      ·网络和光纤布线;
      
      ·设备配置;
      
      ·互操作性测试;
      
      ·工作负载验证;
      
      ·运行移交。
      
      任何一个环节延迟,都可能影响整个集群的上线时间。
      
      多供应商环境需要更加严格的系统验证
      
      大规模人工智能基础设施通常不是由单一厂商提供全部组件。
      
      服务器、GPU、网卡、交换机、光模块、光纤、存储、PDU和冷却系统可能来自不同供应商。
      
      因此,单个组件通过测试,并不意味着整个系统一定能够稳定运行。
      
      在生产部署之前,应重点验证以下内容:
      
      硬件兼容性
      
      检查服务器、加速器、网卡、交换机以及其他设备之间的兼容关系。
      
      光互连性能
      
      验证光模块、光纤、连接器和交换设备之间的互操作性,并确认链路在目标距离和持续负载条件下能够稳定运行。
      
      网络性能
      
      测试实际工作负载下的吞吐量、延迟、拥塞和通信效率,而不仅仅是接口标称速率。
      
      存储和数据路径
      
      验证数据读取、写入、预取、检查点和恢复等任务是否能够满足工作负载要求。
      
      持续运行能力
      
      人工智能任务可能长时间保持高负载,因此需要进行持续压力测试,观察设备性能、电力和温度变化。
      
      电力与冷却能力
      
      在接近目标负载的条件下验证供电稳定性、功率分配和散热能力,确认系统不会因为温度或功率限制而出现性能下降。
      
      从“设备采购”转向“系统工程”
      
      大规模人工智能基础设施建设正在改变传统的数据中心采购逻辑。
      
      过去,项目可能首先确定服务器数量,再根据服务器数量配置网络、电力和机房空间。
      
      而对于高密度人工智能集群,更合理的方法是从工作负载出发,反向推导整个基础设施。
      
      基本逻辑可以概括为:
      
      工作负载需求→计算规模→集群拓扑→网络容量→存储能力→机架功率→冷却能力→物理布局→验证方案
      
      这种方式能够减少后期改造,也有助于提高基础设施利用率。
      
      与此同时,企业还需要建立标准化物料清单和经过验证的设备组合,将硬件、固件、网络配置和软件环境纳入统一管理。
      
      这对于快速复制多个机架或多个集群尤为重要。
      
      面向未来扩展进行基础设施设计
      
      人工智能基础设施的生命周期正在缩短。加速器性能、网络速率、机架功率密度和冷却技术持续发展,使得数据中心不能只针对当前需求进行设计。
      
      未来的基础设施需要具备更强的适应能力。
      
      例如,在建设初期就预留:
      
      ·电力扩容空间;
      
      ·机架位置;
      
      ·光纤和线缆路径;
      
      ·网络端口;
      
      ·冷却能力;
      
      ·配电冗余;
      
      ·设备维护空间;
      
      ·网络和存储扩展能力。
      
      这样可以避免后续升级时出现“计算设备已经可以部署,但设施条件无法跟上”的情况。
      
      与此同时,基础设施设计也需要考虑设备更新周期。如果网络、电源或冷却系统过于封闭,未来升级计算设备时可能需要大规模改造,从而增加长期成本。
      
      总结
      
      大规模人工智能工作负载正在推动数据中心从“服务器中心”向“集群中心”和“系统中心”转变。
      
      在这一过程中,GPU和服务器仍然是核心计算资源,但网络、存储、电力、冷却、机架和物理基础设施已经成为决定系统实际能力的重要因素。
      
      未来的数据中心建设不能只追求更高的峰值性能,而需要关注整个系统能否将硬件能力转化为稳定、持续且可扩展的工作负载性能。
      
      这意味着人工智能基础设施规划需要从单个设备的参数比较,进一步转向机架级设计、集群级优化和系统级验证。只有将计算、网络、存储、供电、散热和部署流程进行统一规划,才能在控制建设复杂度的同时,提高资源利用率,并为后续扩展留下足够空间。
      
      对于正在建设人工智能计算环境的数据中心而言,真正需要规划的并不是“需要多少台服务器”,而是如何构建一个能够持续支撑目标工作负载的完整基础设施系统。
      
      编辑:Harris
      
      

  •