NVIDIA Mellanox MQM9790-NS2F dalam Aksi: Membangun Fabric RDMA Low-Latency untuk AI dan HPC Cluster
August 24, 2026
NVIDIA Mellanox MQM9790-NS2F dalam Aksi: Membangun Fabric RDMA Low-Latency untuk AI dan HPC Cluster
Latar Belakang & Tantangannya: Ketika Meningkatkan Skala Menjadi Hambatan
Sebagai model bahasa besar skala dari ribuan hingga puluhan ribu GPU, dan simulasi cuaca mendorong ke arah resolusi skala kilometer,keterbatasan kain Ethernet tradisional menjadi jelas. Dalam lingkungan ini, pola komunikasi kolektif MPI seperti semua-mengurangi dan semua-ke-semua-menempatkan tuntutan ekstrim pada latensi jaringan dan kontrol kemacetan.bahkan node komputasi yang paling kuat menghabiskan sebagian besar siklus mereka menunggu data, secara efektif menyia-nyiakan sumber daya GPU mahal.
Ini adalah tantangan yang dihadapi olehNVIDIA Mellanox MQM9790-NS2FSebagai saklar NDR InfiniBand 400Gb/s dengan 64 port OSFP, ini dirancang untuk memberikan latensi deterministik, sub-mikrodetik di ribuan titik akhir,memungkinkan skala linier sejati untuk beban kerja terdistribusi.
Solusi & Penerapan: Kain Leaf-Spine Dibangun untuk RDMA
Dalam skenario penyebaran khas untuk laboratorium penelitian AI besar,MQM9790-NS2F InfiniBand switchmembentuk inti dari topologi laba-laba dua tingkat. Pada lapisan daun, setiap rak komputasi dilengkapi dengan satu atau dua unit MQM9790-NS2F,menyediakan 64 port konektivitas 400Gb/s ke server GPU melalui kabel tembaga OSFP-to-OSFP langsung atau kabel optik aktifDi lapisan tulang belakang, tambahan MQM9790-NS2F switch saling menghubungkan daun, menciptakan non-menghalangi lemak-pohon kain dengan full bisection bandwidth.
What makes this solution particularly compelling is the switch's native support for RDMA over Converged Ethernet (RoCE) when operating in InfiniBand mode—though here it leverages InfiniBand's native RDMA capabilities for even lower latency and CPU offload.MQM9790-NS2F 400Gb/s NDR 64-port OSFPmengintegrasikan teknologi SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) dari NVIDIA, yang mengalihkan operasi kolektif langsung ke jaringan switch.ini berarti bahwa operasi semua mengurangi yang biasanya akan melintasi jaringan beberapa kali sekarang selesai dalam satu lulus, mengurangi waktu penyelesaian pekerjaan hingga 30% untuk beban kerja yang intensif komunikasi.
Untuk arsitek jaringan yang mengevaluasiSolusi switch MQM9790-NS2F InfiniBand, proses penyebaran disederhanakan oleh NVIDIA Unified Fabric Manager (UFM). UFM memberikan visibilitas terpusat ke kesehatan kain, penemuan topologi otomatis,dan pemantauan kemacetan yang proaktifPengadopsi awal telah melaporkan bahwaMQM9790-NS2F kompatibelekosistem, yang mencakup berbagai kabel dan transceiver yang disertifikasi NVIDIA, menyederhanakan pengadaan dan mengurangi risiko penyebaran.
Hasil & Keuntungan Terukur: Dari Teori ke Realitas Produksi
Dalam penyebaran produksi baru-baru ini untuk kluster 2.048-GPU yang didedikasikan untuk pelatihan model trafo skala besar, peningkatan dari infrastruktur HDR (200Gb/s) ke NDR (400Gb/s)NVIDIA Mellanox MQM9790-NS2Fpada intinya memberikan peningkatan terukur di berbagai dimensi:
- Pengurangan waktu penyelesaian pekerjaan:Iterasi pelatihan end-to-end untuk model 175B-parameter berkurang 28%, sebagian besar disebabkan oleh SHARPv3 offloading dan penurunan latensi ekor.
- Penggunaan jaringan:Rata-rata pemanfaatan kain meningkat dari 62% menjadi 89% tanpa memicu keruntuhan kemacetan, berkat pergantian rute adaptif canggih dan mekanisme kontrol kemacetan.
- Kesederhanaan operasi:Dengan 64 port per switch, jumlah switch tulang belakang yang dibutuhkan berkurang setengah dibandingkan dengan desain HDR 32 port, secara signifikan mengurangi kompleksitas kabel dan konsumsi daya per rak.
MenurutSpesifikasi MQM9790-NS2F, switch memberikan sub-100ns port-to-port latency dan mendukung hingga 51.2Tb/s dari kapasitas switching agregat √ angka yang selaras erat dengan kinerja yang diamati dalam penyebaran ini.Insinyur jaringan juga mencatat bahwaLembar data MQM9790-NS2Fdengan akurat mencerminkan kinerja dunia nyata, tanpa kejutan selama fase validasi.
Dari perspektif TCO, kemampuan untuk mengkonsolidasikan lebih banyak titik akhir per tingkat switch secara langsung mengurangi pengeluaran modal.Harga MQM9790-NS2Ftitik lebih tinggi daripada solusi 200Gb/s setara, biaya jaringan per GPU sebenarnya menurun karena radix yang lebih tinggi dan jumlah lapisan switch yang berkurang.dikombinasikan dengan peningkatan kinerja, membuat kasus bisnis jelas untuk komite pengarah laboratorium.
Ringkasan & Prospek: Yayasan NDR untuk Exascale Computing
PeraturanNVIDIA Mellanox MQM9790-NS2Fadalah lebih dari peningkatan bertahap, ini mewakili perubahan mendasar dalam cara HPC dan AI cluster dirancang.dan akselerasi komputasi dalam jaringan dalam faktor bentuk 1U tunggal, memungkinkan arsitek untuk membangun kain yang skala ke puluhan ribu titik akhir tanpa mengorbankan kinerja atau manajemen.
Melihat ke depan, karena beban kerja terus menuntut bandwidth yang lebih tinggi dan latensi yang lebih rendah,MQM9790-NS2F InfiniBand switchakan berfungsi sebagai blok bangunan dasar untuk sistem eksascale generasi berikutnya.Kompatibilitas dengan platform NVIDIA Quantum-2 yang ada dan integrasi yang mulus dengan UFM memastikan jalur migrasi yang mulus bagi organisasi yang meningkatkan dari kain HDRUntuk manajer TI dan arsitek yang mengevaluasi investasi jaringan generasi berikutnya, MQM9790-NS2F menawarkansolusi siap produksi yang memberikan janji pengoptimalan interkoneksi RDMA latensi rendah.

