高效能運算(High Performance Computing,HPC)與人工智慧(AI)數據中心高度依賴RDMA(Remote Direct Memory Access),以降低節點間通訊延遲與 CPU 負擔。實現 RDMA 的網路架構,除了專用的 InfiniBand 之外,本文先聚焦在RoCE(RDMA over Converged Ethernet)。
RoCE 在業界裡通常讀作“Rocky”。
其中,RoCE協定目前主流是第二版,也就是RoCEv2,其封裝格式如首圖所示,本質上就是另外一種運用Ethernet/IP/UDP的運輸方式,所運輸的乘客就是InfiniBand 的傳輸層封包(InfiniBand Transport Layer/Header)與 RDMA 數據內容。
由於傳統乙太網(Ethernet)屬於允許丟包的「盡力傳送但完全不保證(Best-effort)」網路,無法直接滿足 RDMA 對零丟包的要求,因此乙太網必須加入新的功能,來達到確保在乙太網內可控制成不會丟失封包(Lossless Ethernet),才能成功而且正確的運載RDMA的通訊。並非任意搭建的乙太網就可以直接載送RDMA流量。
加入的新功能,必須包括:
- 優先值分開的流量控制(Priority Flow Control,PFC)
- 網路設備(如交換機與網卡)須能辨識 RDMA 的傳輸標頭(InfiniBand BTH),並給予適當的 QoS 優先值劃分。
- 網路層IP通常需要支援明確壅塞通知(Explicit Congestion Notification,ECN),中間的網路設備標記發生壅塞,由接收端通知發送端的網卡傳輸層調降發送速率。


0 意見:
張貼留言
小技巧:也可以 匿名 留言!