NNetpath
原理深入预计 30 分钟

Fat-Tree 与 Rail-Optimized 拓扑

GPU 集群的网络拓扑不是"接上就行",接错了 AllReduce 直接掉一半带宽。

学完这节你能做到

  • 画出两层 Fat-Tree 并算出它的无阻塞条件
  • 解释 rail-optimized 布线为什么能让同 rail 通信只走一跳
  • 说清 NVLink 域与网络域的边界在哪
正文待编写以下是本节已定稿的小节大纲
  1. 1Fat-Tree / Spine-Leaf:为什么它成了事实标准
  2. 2无阻塞与收敛比:上行下行端口账
  3. 3Rail-Optimized:每张网卡对应一个 rail
  4. 4同 rail 一跳,跨 rail 走 spine
  5. 5NVLink 与网络的分工:机内 vs 机间
  6. 6按 SU 布线:宁可留空位也要把 leaf 接满

延伸资料