Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch dalam Aksi

July 13, 2026

berita perusahaan terbaru tentang Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch dalam Aksi

Mellanox (NVIDIA Mellanox) MQM9790-NS2F InfiniBand Switch dalam Aksi Optimasi Interkoneksi Low-Latency untuk Kluster RDMA / HPC / AI

Karena cluster pelatihan AI berskala dari ribuan hingga puluhan ribu GPU, latensi jaringan dan kontrol kemacetan menjadi faktor penentu dalam pemanfaatan komputasi yang efektif.Sebuah organisasi penelitian AI terkemuka di dunia baru-baru ini menggunakanMellanox (NVIDIA Mellanox) MQM9790-NS2Fberalih untuk mendukung fasilitas superkomputer generasi berikutnya, mendukung model bahasa skala besar, simulasi dinamika molekuler, dan pembelajaran mendalam terdistribusi.Artikel ini mengkaji penyebaran dunia nyata, merinci bagaimana switch InfiniBand ini mengubah transportasi RDMA, komunikasi HPC, dan kain pelatihan data paralel AI.

Latar Belakang & Tantangan: Dari Kompromi Ethernet ke Imperatif Interkoneksi Tanpa Kerugian

Organisasi ini awalnya mengandalkan jaringan Ethernet 100GbE dengan RoCEv2. Namun, ketika node GPU mereka tumbuh menjadi lebih dari 1.200 server (masing-masing dengan 8× NVIDIA H100 GPU),mereka mengalami kemacetan PFC yang terus-menerus, penyesuaian ECN yang kompleks, dan drop paket sesekali yang menyebabkan training stalls.Masalah ini memperpanjang waktu penyelesaian pekerjaan rata-rata lebih dari 35% dan mengkonsumsi upaya teknik yang cukup dalam pemecahan masalah jaringanInfrastruktur yang ada tidak lagi dapat memberikan latensi tingkat mikrodetik deterministik dan throughput bebas kemacetan yang diperlukan untuk operasi all-reduce dan all-to-all yang besar.

Solusi & Pengembangan:MQM9790-NS2F InfiniBand Switchsebagai Backbone Kain

Setelah mengevaluasi beberapa alternatif, tim memilihNVIDIA Mellanox MQM9790-NS2Fsebagai blok bangunan inti untuk arsitektur leaf-spine dua tingkat baru.MQM9790-NS2F 400Gb/s NDR 64-port OSFPswitch, menyediakan 64 port OSFP per unit dan kapasitas switching total 25,6 Tb/s. Kecepatan NDR 400 Gb/s per port, dikombinasikan dengan cut-through switching dan routing adaptif,memungkinkan sub-600 ns port-to-port latency a persyaratan penting untuk beban kerja GPU-intensif mereka. Pengerahan memanfaatkanSolusi switch MQM9790-NS2F InfiniBandterintegrasi dengan NVIDIA Quantum‐2 firmware, memastikan mulusMQM9790-NS2F kompatibeloperasi dengan adaptor ConnectX-7 dan DPU BlueField-3 yang ada.

Pilihan utama penyebaran termasuk:

  • Topologi:Non-menghalangi fat-tree dengan 64-port OSFP ke 400G transceiver optik, memungkinkan full-bisection bandwidth untuk semua GPU node.
  • Manajemen:NVIDIA UFM (Unified Fabric Manager) untuk telemetri real-time, deteksi kemacetan, dan re-routing jalur proaktif.
  • Pengungkapan kolektif:SHARPv3 memungkinkan untuk mempercepat operasi all-reducing, melepaskan komunikasi dari CPU host.

Untuk memastikan transisi yang lancar, tim berkonsultasi denganLembar data MQM9790-NS2FdanSpesifikasi MQM9790-NS2Funtuk memvalidasi kebutuhan daya dan kabel. faktor bentuk 1U dan sumber daya redundant sesuai dengan baik ke dalam kepadatan rak mereka yang ada dan port OSFP mendukung kabel DAC dan modul optik,menawarkan fleksibilitas untuk ekspansi di masa depan.

Hasil & Manfaat yang Diukur

Setelah penyebaran dan optimalisasi penuh, organisasi mendokumentasikan peningkatan yang signifikan di berbagai dimensi:

Metrik Sebelum (RoCEv2) Setelah (MQM9790-NS2F)
Rata-rata All-Reduce Latency (1GB) ~ 18 μs < 8 μs
Latensi ekor (99.9th %ile) > 150 μs < 15 μs
Penggunaan GPU yang Efektif ~ 72% ~91%
Waktu penyelesaian pekerjaan (rata-rata) Garis awal -28% (1,4 kali lebih cepat)

Di luar angka mentah, tim melaporkan gangguan yang berhubungan dengan kemacetan hampir nol, sangat menyederhanakan operasi jaringan.NVIDIA Mellanox MQM9790-NS2Fmemungkinkan otomatis load balancing di semua 64 port OSFP, menghilangkan manual ECN tweaking.MQM9790-NS2F InfiniBand switchmemberikan kinerja deterministik bahkan di bawah 95% pemanfaatan link, sebuah prestasi yang tidak mungkin dengan pengaturan Ethernet sebelumnya.

Organisasi ini juga mencatat bahwaHarga MQM9790-NS2F, ketika amortized selama siklus hidup 5 tahun, diimbangi oleh konsumsi daya yang berkurang per port (≈1,5W per port 400G) dan biaya kabel yang lebih rendah karena kepadatan port yang lebih tinggi.Dengan ketersediaan umum sekarang matang, mereka mengkonfirmasi bahwaMQM9790-NS2F untuk dijualmelalui saluran resmi dibuat pengadaan langsung, danLembar data MQM9790-NS2Fmemberikan semua rincian pemasangan dan kepatuhan yang diperlukan.

Ringkasan & Prospek A Blueprint for Next‐Gen AI Infrastructures

AdopsiMellanox (NVIDIA Mellanox) MQM9790-NS2Fdalam cluster HPC/AI berskala besar ini menunjukkan bahwa kain InfiniBand yang dibangun khusus bukan lagi kemewahan tetapi kebutuhan bagi organisasi yang mendorong batas AI dan komputasi ilmiah.Dengan memberikan latensi sub-mikrosekund yang konsisten, lossless RDMA transport, dan akselerasi komputasi dalam jaringan,MQM9790-NS2F 400Gb/s NDR 64-port OSFPswitch memungkinkan pusat data untuk mencapai skalabilitas hampir linier hingga puluhan ribu GPU.

Menatap ke depan, tim berencana untuk memperluas kain dengan tambahanMQM9790-NS2F InfiniBand switchunit untuk mendukung beban kerja kelas eksascale yang akan datang, termasuk pemodelan iklim dan genomik.MQM9790-NS2F kompatibelUntuk arsitek dan manajer TI yang mengevaluasi upgrade serupa, kasus dunia nyata ini menegaskan bahwaSolusi switch MQM9790-NS2F InfiniBandmenawarkan jalan yang terbukti dan hemat biaya menuju jaringan cluster berkinerja tinggi dan latensi rendah – sebuah faktor penting untuk inovasi AI pada dekade berikutnya.