NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch dalam Aksi: Mengoptimalkan Interkoneksi Low-Latency untuk RDMA / HPC / AI Cluster

August 21, 2026

berita perusahaan terbaru tentang NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch dalam Aksi: Mengoptimalkan Interkoneksi Low-Latency untuk RDMA / HPC / AI Cluster

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch dalam Aksi: Mengoptimalkan Interkoneksi Low-Latency untuk RDMA / HPC / AI Cluster

Dalam bidang pelatihan model AI skala besar dan komputasi berkinerja tinggi (HPC), latensi jaringan sering menjadi kemacetan kritis yang membatasi skalabilitas dan efisiensi cluster.Sebuah pusat superkomputer tingkat nasional baru-baru ini menyelesaikan peningkatan infrastruktur besar, transisi dari 100Gb/s EDR InfiniBand kain untuk 200Gb/s solusi HDR dibangun di sekitarNVIDIA Mellanox MQM8790-HS2FInfiniBand switch. studi kasus ini memeriksa tantangan yang mereka hadapi, strategi penyebaran, dan keuntungan kinerja terukur yang dicapai melalui interkoneksi generasi berikutnya ini.

Latensi menjadi batas kinerja

Pusat supercomputing mengoperasikan kluster heterogen yang terdiri dari lebih dari 2.000 node GPU, mendukung campuran beban kerja yang beragam yang mencakup simulasi cuaca, penelitian genom,dan pelatihan model bahasa besarDengan jaringan EDR 100Gb/s sebelumnya,tim operasi mengamati bahwa operasi komunikasi kolektif “seperti semua-mengurangi dan semua-mengumpulkan “mengkonsumsi semakin besar dari total waktu kerja karena jumlah node meningkatDalam beberapa pekerjaan pelatihan terdistribusi, overhead yang terkait dengan jaringan menyumbang hampir 40% dari waktu eksekusi end-to-end, sangat membatasi pemanfaatan GPU dan memperpanjang siklus konvergensi model.

Tantangan tambahan termasuk:

  • Titik panas kemacetan:Pola lalu lintas dalam pelatihan AI seringkali meledak dan tidak dapat diprediksi, menyebabkan blokir kepala baris dan lonjakan latensi ekor yang mengganggu penjadwalan pekerjaan.
  • Akselerasi dalam jaringan yang tidak cukup:Fabrik warisan tidak memiliki dukungan untuk kemampuan offload kolektif lanjutan, memaksa semua operasi pengurangan untuk melintasi CPU host dan hierarki memori.
  • Kompleksitas manajemen:Masalah pemecahan masalah kinerja membutuhkan analisis manual dari beberapa alat pemantauan, sehingga sulit untuk menentukan penyebab dalam penyebaran skala besar.

Setelah mengevaluasi beberapa pilihan interkoneksi, pusat memilihMQM8790-HS2Fsebagai dasar untuk kain baru.Lembar data MQM8790-HS2F, switch ini memberikan 40 port 200Gb / s HDR non-menghalangi throughput, sub-130ns cut-through latency, dan dukungan untuk SHARP v3.0 kapasitas offload kolektif yang secara langsung mengatasi titik nyeri inti mereka.

Solusi dan penyebaran: Membangun kain latensi rendah untuk AI/HPC

Penyebaran ini mengadopsi topologi pohon lemak dua tingkat, dengan 24MQM8790-HS2F 200Gb/s HDR 40-port QSFP56switch yang digunakan sebagai node daun dan 8 unit sebagai switch tulang belakang.1 oversubscription di seluruh cluster yang cukup untuk beban kerja mereka saat ini sementara memungkinkan ruang untuk ekspansi di masa depan.

Lapisan penyebaran Jumlah Switch Pelabuhan yang Digunakan Konektivitas
Daun (per rak) 24 32 pelabuhan setiap ToR server + uplink tulang belakang
Tulang belakang 8 36 pelabuhan setiap Full mesh untuk semua switch daun

Setiap switch daun terhubung ke node komputasi melalui adaptor saluran host NVIDIA ConnectX-6 HDR.MQM8790-HS2F kompatibeloptik dan ekosistem kabel memungkinkan tim untuk menggunakan kembali kabel QSFP56 yang ada, mempercepat penyebaran dan mengurangi biaya pengadaan. Seluruh instalasi fisik selesai dalam waktu dua minggu,dengan pesawat kontrol memanfaatkan NVIDIA Unified Fabric Manager (UFM) untuk penemuan topologi otomatis dan penyediaan.

Dukungan switch untuk routing adaptif dan kontrol kemacetan terbukti penting untuk menangani karakteristik lalu lintas yang melebar dari beban kerja AI.Dengan mendistribusikan kembali aliran secara dinamis di seluruh jalur yang tersedia, yangMQM8790-HS2F InfiniBand switchmeminimalkan pembentukan hotspot dan mempertahankan kinerja yang konsisten bahkan selama periode jadwal pekerjaan puncak.

Hasil dan Keuntungan: Peningkatan yang dapat diukur dalam Keterlibatan Pekerjaan dan Penggunaan GPU

Setelah tiga bulan operasi produksi, pusat superkomputer melaporkan peningkatan kinerja yang signifikan di berbagai dimensi:

  • Pengurangan latensi:Rata-rata MPI ping-pong latensi berkurang dari 680 ns pada kain EDR sebelumnya untuk di bawah 130 ns denganNVIDIA Mellanox MQM8790-HS2F, yang mewakili peningkatan 5x dalam efisiensi pertukaran pesan.
  • Kecepatan operasi kolektif:All-reducing latency untuk pekerjaan 1024 node turun 62%, berkat SHARP v3.0 offload yang melakukan operasi pengurangan langsung di dalam jaringan switch.
  • Penggunaan GPU:Efek gabungan dari latensi yang lebih rendah dan bandwidth yang lebih tinggi mendorong pemanfaatan GPU rata-rata dari 72% menjadi 91%, yang diterjemahkan ke pengurangan 26% dalam waktu-ke-solusi untuk menjalankan pelatihan model bahasa besar.
  • Efisiensi penjadwalan pekerjaan:Varian latensi ekor yang berkurang memungkinkan penjadwal SLURM untuk mengemas lebih banyak pekerjaan ke dalam set node yang sama tanpa gangguan kinerja, meningkatkan keseluruhan throughput cluster sekitar 18%.

Ketika tim kemudian membandingkanHarga MQM8790-HS2Fterhadap switch alternatif dari vendor lain, they found that the total cost per Gb/s delivered was highly competitive—especially when factoring in the reduced management overhead and the switch's ability to support both HDR and HDR100 link speeds, melindungi investasi di lingkungan kecepatan campuran.

Dari perspektif operasional, platform UFM terintegrasi menyediakan satu panel kaca untuk memantau kesehatan kain, pola lalu lintas, dan kesalahan tingkat link.Visibilitas ini memungkinkan tim untuk secara proaktif mengidentifikasi kabel degradasi dan mengganti mereka selama pemeliharaan terjadwal, menghindari downtime yang tidak direncanakan.

Ringkasan dan Prospek: Rancangan untuk Kain Low-Latency Generasi Berikutnya

Studi kasus ini menunjukkan bahwaMQM8790-HS2F Solusi saklar InfiniBandadalah lebih dari sekadar peningkatan kecepatan, ini adalah komponen transformatif bagi organisasi yang ingin membuka potensi kinerja penuh dari infrastruktur AI dan HPC mereka.Dengan menggabungkan kepadatan pelabuhan yang tinggi, latensi ultra rendah, dan kemampuan komputasi dalam jaringan, switch langsung mengatasi kemacetan komunikasi yang secara historis memiliki skalabilitas cluster terbatas.

Melihat ke depan, pusat supercomputing berencana untuk memperluas jaringan ke 2.400 node di tahun fiskal berikutnya, memanfaatkan yang samaMQM8790-HS2Ftim juga mengeksplorasi dukungan switch untuk algoritma pengurangan SHARP v3.0 yang ditingkatkan,yang menjanjikan untuk lebih mempercepat beban kerja yang muncul seperti jaringan saraf grafik dan pembelajaran penguatan.

Untuk manajer TI, arsitek jaringan, dan insinyur yang mengevaluasi pilihan interkoneksi untuk cluster build mereka sendiri,NVIDIA Mellanox MQM8790-HS2Fmenawarkan jalan yang terbukti, validasi lapangan untuk mencapai sub-microsecond latency, memaksimalkan pemanfaatan GPU, dan manajemen kain yang disederhanakan.Spesifikasi MQM8790-HS2Fdan desain referensi tersedia dari portal dokumentasi teknis NVIDIA dan switch sekarang tersedia secara luasMQM8790-HS2F untuk dijualuntuk menemukan mitra regional.