为了解决超大规模 AI 集群中网络拥塞和尾部延迟对分布式训练效率的影响,NVIDIA Spectrum-X Multiplane 采用拓扑并行架构,在交换矩阵侧有 8 个物理独立的两层网络平面(Plane 0-7),在计算侧有 4 个高带宽物理轨(Rail 0-3),从而实现分布式流量和低延迟连接。
然而,在8面/4轨架构中,单个服务器的4个Rails无法直接一对一映射到所有8个面。服务器之间需要互补的轨到平面连接来覆盖整套平面。随着集群的扩展,这些交错连接会导致大量的点对点布线,从而增加了电缆管理、连接识别和维护的复杂性。
为了解决这一布线挑战,Dilight 提供了两种 Shuffle 解决方案。 4×4 Shuffle Cable 作为标准化物理连接单元,将两台服务器的四个 Rail 组合成两个 Shuffle Cable 组件,并将它们连接到互补的平面组,例如 Plane 0/2/4/6 和 Plane 1/3/5/7,以系统地覆盖所有八个平面。其预映射和集成设计降低了众多单独电缆的复杂性,创建更有条理的物理连接并简化安装、识别和维护。
Shuffle Box 将复杂的 8 平面光学映射封装在标准 1U/4U 机箱内,计算节点通过短跳线连接到主机侧,远程叶子交换机通过标准 MPO 主干电缆连接到结构侧。通过集中复杂的交错以及将计算侧连接与主干布线解耦,可以减少电缆混乱并简化网络扩展、设备搬迁和有针对性的链路维护。






























