原理深入预计 30 分钟
Fat-Tree 与 Rail-Optimized 拓扑
GPU 集群的网络拓扑不是"接上就行",接错了 AllReduce 直接掉一半带宽。
学完这节你能做到
- 画出两层 Fat-Tree 并算出它的无阻塞条件
- 解释 rail-optimized 布线为什么能让同 rail 通信只走一跳
- 说清 NVLink 域与网络域的边界在哪
正文待编写以下是本节已定稿的小节大纲
- 1Fat-Tree / Spine-Leaf:为什么它成了事实标准
- 2无阻塞与收敛比:上行下行端口账
- 3Rail-Optimized:每张网卡对应一个 rail
- 4同 rail 一跳,跨 rail 走 spine
- 5NVLink 与网络的分工:机内 vs 机间
- 6按 SU 布线:宁可留空位也要把 leaf 接满