NNetpath

系统与集群网络成长路径

从一个包走过的每一跳,到一整套 GPU 集群的布线账

先把 Linux 协议栈上的收发路径走通,紧接着拿下代理与隧道这套立刻能用的工具箱, 再拆开 K8s 容器网络那些看似魔法的机制,然后进入 PCIe / NVLink 与 InfiniBand / RoCE 的高性能战场,最后学会把业务需求翻译成端口数与线缆数。每个阶段再拆成几个小组, 组内按依赖顺序排列。

6 个
学习阶段
54 节
课程
25 节
已有正文
29 小时
预计学时

新手路线

14 节 · 约 7 小时 · 已完成 0/14

零经验、不知道从哪下手就照这条走。全部选的是已有正文的课,顺序与下面的目录一致: L0 打完基础,紧接着是代理与 SSH 这类入职第一周就用得上的工具,再进容器网络。

  1. 1L0从一次 curl 说起:网络到底是什么25
  2. 2L0带宽、延迟、PPS:三个指标与必背换算25
  3. 3L0二层与三层:ARP、VLAN、子网与转发30
  4. 4L0一个包的旅程:从 send() 到网线30
  5. 5L0TCP 的脾气:握手、窗口、拥塞与重传30
  6. 6L0网络观测工具箱:ss、ethtool、tcpdump、nstat30
  7. 7L0闯关:一台"网络慢"的机器25
  8. 8THTTP 代理与 SOCKS5:两种代理差在哪30
  9. 9TSSH 端口转发:-L、-R、-D 三把钥匙40
  10. 10L1K8s 网络模型:四条铁律25
  11. 11L1CNI 与数据平面:overlay、原生路由与 eBPF35
  12. 12L1Service:一个不存在的 IP 是怎么工作的35
  13. 13L2为什么需要 RDMA:内核旁路与零拷贝30
  14. 14L3以太网规划:Spine-Leaf 端口账与收敛比35

走完这条线再按下面的方向深入。标「深入」的课可以先跳过,遇到具体问题再回来。

按目标选起点

不必从第一节按顺序啃到最后。挑一个和当前工作最近的入口进去, 课程页会提示这一节需要先补哪几节。

学习路径

每个阶段按小组推进,点小组名进去看具体课程
L0
网络基础Linux 协议栈与观测

所有网络问题的地基。搞清一个包从应用到网线要经过哪些环节,每个环节能用什么命令看,以及延迟、带宽、PPS 三个指标各自受什么限制。

0/8
已完成
  1. 1从这里开始1 节 · 25 分钟还没有实际排障经验就从这节起。一次 curl 串起全过程,把后面要用的名词一次性认全。
  2. 2打地基2 节 · 55 分钟先统一口径、再看清二三层怎么转发。这两节后面每一课都要用到,跳过去会处处别扭。
  3. 3走通一个包3 节 · 95 分钟 · 正文 2/3沿着收发路径走一遍,再看 TCP 的实际行为和内核侧能动的旋钮。
  4. 4动手排障2 节 · 55 分钟把前面的知识收成一套固定的命令顺序,然后拿一个真实故障练手。
T
代理与隧道旁路工具箱 · 学完 L0 即可

工程师的日常工具箱:把内网服务安全地暴露给自己、把本地流量按规则送出去、把散落各处的机器组成一张网。它不在 L0→L4 那条主线上 —— 只依赖 L0 的基础,学完立刻能用,所以排在这里而不是压到最后。

0/12
已完成
  1. 1代理与端口转发4 节 · 135 分钟 · 正文 3/4两种代理的区别、ssh 的三把钥匙,以及 ssh 搞不定(UDP、长期穿透)时换成 gost。
  2. 2VPN 组网3 节 · 105 分钟 · 正文 2/3从两台机器的 WireGuard,到自动组网的 Tailscale,再到需要组织与审计时的 Pritunl。
  3. 3受限网络实战4 节 · 135 分钟 · 正文 2/4先诊断再动手:分清症状、看懂流量特征、写对分流规则,必要时做成网关。
  4. 4排障1 节 · 30 分钟 · 正文 0/1隧道昨天还好今天不通,从客户端一路查到出口。
L1
容器网络K8s 网络模型与 CNI

把 K8s 网络从"魔法"变成可推导的机制。Pod 之间怎么通、Service 的 VIP 是谁在翻译、流量从集群外进来经过哪几跳,全都能画出来。

0/10
已完成
  1. 1网络模型与数据平面3 节 · 95 分钟 · 正文 2/3先看清 K8s 定下的四条约束,再用 ip 命令手搓一个满足它的最小网络,最后看各家 CNI 的取舍。
  2. 2Service 与南北流量5 节 · 155 分钟 · 正文 1/5一个不存在的 IP 怎么工作、VIP 怎么让物理网络知道、L7 入口与 DNS 策略各在哪一层生效。
  3. 3扩展与排障2 节 · 65 分钟 · 正文 0/2给 Pod 插第二张网卡,然后练一次「Pod 之间不通」。
L2
高性能网络机内互联与 RDMA 网络

AI 训练与高性能存储的主战场。先看清机内:PCIe 拓扑决定网卡能不能跑满、NVLink 决定 GPU 之间有多快;再看机间:RDMA 为什么快、无损以太网靠什么撑住,以及怎么把一条链路从网卡打通到 NCCL 跑出正常带宽。

0/10
已完成
  1. 1机内互联2 节 · 70 分钟PCIe 决定网卡能不能跑满,NVLink 决定 GPU 之间有多快。机间网络的账建立在这两笔账之上,所以先看机内。
  2. 2RDMA 原理3 节 · 105 分钟 · 正文 2/3为什么快、IB 与 RoCE 差在哪,以及无损以太网到底靠什么撑住。
  3. 3打通一条链路2 节 · 75 分钟 · 正文 0/2先在两台裸机之间跑出线速,再把 RDMA 交给容器。原理讲完就动手,别等到最后。
  4. 4集群拓扑与集合通信3 节 · 100 分钟 · 正文 1/3拓扑决定 AllReduce 能跑多快,而 busbw 是验收整条链路的唯一指标。
L3
网络规划以太网与高性能网络

把业务需求翻译成端口数、交换机数、线缆数和地址段。以太网算收敛比与接入账,高性能网络算 rail、SU 与无阻塞条件。

0/5
已完成
  1. 1把需求变成数字1 节 · 25 分钟 · 正文 0/1业务话术里没有一个可以拿去采购的数字,先问出来。
  2. 2以太网这一套2 节 · 65 分钟 · 正文 1/2端口账与收敛比,加上一次性决定、长期后悔的地址规划。
  3. 3计算网这一套2 节 · 70 分钟 · 正文 1/2Rail 布线账,以及最后那道 IB / RoCE / Spectrum-X 的选型题。
L4
进阶专题加速、卸载与协议

按需取用的专题库。每个专题回答三个问题:它解决什么问题、代价是什么、什么场景下真的需要它。

0/9
已完成
  1. 1绕开常规数据路径3 节 · 95 分钟 · 正文 1/3从把网卡切给容器,到把逻辑塞进内核,再到干脆自己轮询。三种做法由浅入深,代价也依次变大。
  2. 2GPU 与存储专项4 节 · 115 分钟 · 正文 0/4把 L2 的 RDMA 知识往上接:显存直通、远端盘、集合通信库,以及卸载到卡上的趋势。
  3. 3长期运维2 节 · 55 分钟 · 正文 0/2把前面所有东西变成看板、告警,和别人能照着执行的流程。