Netpath
49 lessons · 4 steps · 约 26 hours

从查得到资料,到给整个集群值班。

这是一条网络工程师的成长路线。49 节课排成一条线:先解决「查得到一手资料、连得上集群」这件事,再从以太网走到 RDMA 与 GPU 集群、容器网络,最后能替业务算出端口数与线缆数,也扛得住值班。每一段都按同一种节奏推进 —— 先概念、再实践,最后才拆原理:先知道这是什么,然后动手把命令敲一遍,撞到瓶颈时再回头看内核和硬件里发生了什么。没有分岔,也不用挑,从第一节往下走就行。

从第一节开始

已完成 0/49
0%
开始学 · 第 1 节 为什么要先解决这件事:症状分类与诊断
GFW
第 1 步科学上网与隧道看得到一手资料 · 一切的前置 · 6 节 · 210 分钟

一手资料几乎都在海外,集群也在跳板机后面。这两件事不解决,后面每一节都打折。

0/6
  1. 1为什么要先解决这件事:症状分类与诊断一手资料在海外。但动手搭隧道之前先做诊断——「打不开」有四种原因,三种不需要隧道。30m
  2. 2VPS 与 anytls:自己搭一条稳定的线决定体验的是回程线路和协议选型,不是机器配置。1 核 1G 就够,线路差三倍。40m
  3. 3客户端与分流规则:Mihomo 配置真正决定体验的不是节点,是规则:什么直连、什么走代理、DNS 交给谁。35m
  4. 4HTTP 代理与 SOCKS5:两种代理差在哪线已经通了,回头看配置里抄过的那些 http:// 与 socks5h://:一个懂 HTTP,一个只搬字节。30m
  5. 5SSH 端口转发与配置固化:-L、-R、-D 与 ~/.ssh/config换一种隧道:不靠客户端软件,用 ssh 自己开一条。三个参数记混是常态,一个口诀就能分清。45m
  6. 6闯关:隧道昨天还好,今天不通了在模拟终端里从「浏览器打不开」一路查到具体哪一跳断了。30m
ETH
第 2 步以太网与协议栈Linux 协议栈、观测与端口账 · 9 节 · 265 分钟

所有网络问题的地基:一个包从应用走到网线要经过哪些环节,每一环能用什么命令看。

0/9
  1. 1从一次 curl 说起:网络到底是什么不谈调优、不谈参数。用一条命令把 DNS、TCP、TLS、HTTP 串起来,顺手把后面要用的名词认全。25m
  2. 2带宽、延迟、PPS:三个指标与必背换算Gbps 与 GB/s 差 8 倍,小包场景真正的瓶颈是 PPS 不是带宽。这节把口径统一。25m
  3. 3二层与三层:ARP、VLAN、子网与转发交换机怎么决定往哪个口发,路由器怎么决定下一跳,以及同网段与跨网段的区别。30m
  4. 4网络观测工具箱:ss、ethtool、tcpdump、nstat一套固定顺序的命令清单,让你在陌生机器上十分钟内摸清网络状态。30m
  5. 5闯关:一台"网络慢"的机器报障只有两个字"网慢"。在模拟终端里按路径逐层收敛,找出真正的原因。25m
  6. 6以太网规划:Spine-Leaf 端口账与收敛比给定节点数和网卡规格,算出需要几台 leaf、几台 spine、多少线缆、收敛比多少。35m
  7. 7一个包的旅程:从 send() 到网线把发包和收包路径拆成可观测的若干段,后面所有排障都是在这条路径上定位。30m
  8. 8TCP 的脾气:握手、窗口、拥塞与重传为什么带宽没跑满却觉得慢?多半是窗口、重传和排队在起作用。30m
  9. 9内核网络栈调优:中断、队列与 offload同一张网卡,配置对不对能差出几倍性能。这节讲能动的旋钮和动的理由。35m
HPC
第 3 步高性能网络机内互联、RDMA 与网络库 · 18 节 · 580 分钟

AI 训练与高性能存储的主战场:为什么要绕开内核,以及怎么把一条链路打通到 NCCL。

0/18
  1. 1为什么需要 RDMA:内核旁路与零拷贝同样的 100Gbps 网卡,TCP 与 RDMA 的延迟差一个数量级。差在哪里,代价是什么。30m
  2. 2InfiniBand 架构:子网管理器、LID 与 UFMIB 不是"快一点的以太网",它是另一套体系:地址、路由、拥塞控制全都自成一家。35m
  3. 3RoCEv2 与无损以太网:PFC、ECN 与 DCQCN把 RDMA 跑在以太网上,全部难点集中在一件事:不能丢包。40m
  4. 4Fat-Tree 与 Rail-Optimized 拓扑GPU 集群的网络拓扑不是"接上就行",接错了 AllReduce 直接掉一半带宽。30m
  5. 5策略路由:多网卡机器的 ARP 与选路八卡 RoCE 节点上 ib_send_bw 连得上但走错网卡。根因不在网卡,在 Linux 的默认行为。30m
  6. 6动手:用 perftest 打通第一条 RDMA 链路ib_send_bw 跑不出线速时,问题几乎总在 GID、设备名或 MTU 上。35m
  7. 7动手:NCCL 与 busbw 判读AllReduce 的 busbw 是 GPU 集群的网络体检报告。这节讲怎么跑、怎么读、怎么调。40m
  8. 8闯关:AllReduce 只有理论值一半两节点 16 卡,busbw 卡在一半上不去。在模拟终端里查出它到底走没走 RDMA。30m
  9. 9需求拆解:从业务话术到端口和带宽"我们要建个 AI 集群"这句话里没有一个可采购的数字。这节讲怎么问出来。25m
  10. 10选型对比:IB、RoCE 与 Spectrum-X同一笔预算三种方案,差别不在峰值带宽,在运维成本和确定性。30m
  11. 11高性能网络规划:SU、Rail 与线缆账按 GPU 数算出计算网的 leaf/spine 台数与线缆数,并核对无阻塞条件。40m
  12. 12PCIe:机内的那张网PCIe 不是总线而是一张交换网。槽位插错、代际不对,400G 网卡只能跑出一半。35m
  13. 13NVLink 与 NVSwitch:机内的 GPU 高速网GPU 之间走 PCIe 太慢,于是有了另一张网。搞清它的边界在哪,才知道哪些流量会上机间网络。35m
  14. 14GPUDirect RDMA 与 GPUDirect Storage让网卡直接读写显存,把 CPU 和主存彻底从数据路径上摘掉。30m
  15. 15MPI 与集合通信:谁在真正搬数据MPI 在 AI 训练里常常只是个启动器,真正的通信由 NCCL 完成。搞清分工才能调对。30m
  16. 16NVMe-oF:把 NVMe 协议搬到网络上远端盘做到接近本地盘的延迟,靠的是不做协议转换。30m
  17. 17DPU 与 Spectrum-X:把网络卸载到卡上交换机和网卡开始跑自己的操作系统。这对运维意味着多了一层要管的东西。25m
  18. 18DPDK:用户态轮询与大页内存把网卡从内核手里抢过来自己轮询,换来极低延迟和整核的 CPU 占用。30m
K8S
第 4 步K8s 网络容器网络与高性能网络接入 · 16 节 · 505 分钟

容器网络看起来像魔法,拆开只有几层封装。把物理网与 RDMA 接进集群,最后收尾到值班。

0/16
  1. 1K8s 网络模型:四条铁律K8s 不实现网络,它只规定了几条必须满足的约束。理解约束,才能理解各家 CNI 的取舍。25m
  2. 2CNI 与数据平面:overlay、原生路由与 eBPF同一个网络模型有三种实现路线,性能与运维复杂度差别很大。35m
  3. 3Service:一个不存在的 IP 是怎么工作的ClusterIP ping 不通却能访问。把这件事讲透,Service 的四种类型就都通了。35m
  4. 4MetalLB:裸金属集群的 LoadBalancer云上一行 type: LoadBalancer 就有 VIP,裸金属得自己实现。两种宣告方式,选错了要么不通、要么只有高可用没有负载均衡。35m
  5. 5南北流量:Ingress、Gateway API 与出口治理流量从集群外进来的几种正规入口,以及出方向该不该管、怎么管。30m
  6. 6CoreDNS 与 NetworkPolicy集群里一半的"网络故障"其实是 DNS;另一半是策略拦了没人知道。25m
  7. 7地址与 VLAN 规划:给集群划地盘地址规划是一次性决定、长期后悔的事。Pod CIDR 划小了以后加不了节点。30m
  8. 8SR-IOV、MacVLAN 与 IPvlan:把网卡切给容器三种让容器贴近物理网的方式,性能与灵活度各有取舍。30m
  9. 9动手:给 Pod 插第二张网卡AI 训练和虚拟机场景都需要 Pod 直连物理网。Multus、Spiderpool、MacVLAN 的实际配法。35m
  10. 10动手:K8s 里把 RDMA 交给 Podnetwork-operator、rdma/hca 资源、hostNetwork 与 MacVLAN 两种模式的实际配法。40m
  11. 11闯关:Pod 之间不通同一个 Service 有些副本能访问、有些不行。在模拟终端里一层层剥开。30m
  12. 12动手:用 netns 和 veth 手搓一个容器网络不用 K8s、不用 Docker,纯 ip 命令把两个"容器"连通,容器网络就没有秘密了。35m
  13. 13kube-proxy 的三代实现与 eBPF 替换iptables 模式在几千个 Service 时会退化。这节讲退化的原因和替代方案。30m
  14. 14eBPF 与 XDP:把逻辑塞进内核路径从 Cilium 到网络可观测性,eBPF 已经是容器网络的默认答案。35m
  15. 15网络可观测性:指标、流日志与抓包把"网络好不好"变成可以画在看板上、能告警的具体数字。30m
  16. 16网络值班手册:SOP 与容量复盘把前面所有知识固化成别人也能照着执行的流程,这才是工程师的产出物。25m

顺序是建议不是限制 —— 已经有底子的话,直接跳到对应一段也行。想先动手,实验与闯关把全部动手环节单独汇总在了一起。