NVIDIA Mellanox 920-9B110-00FH-0D0 Referensi teknis: Optimisasi Low-Latency Interconnect untuk RDMA/HPC/AI

August 25, 2026

NVIDIA Mellanox 920-9B110-00FH-0D0 Referensi teknis: Optimisasi Low-Latency Interconnect untuk RDMA/HPC/AI

Referensi Teknis NVIDIA Mellanox 920-9B110-00FH-0D0: Interkoneksi Latensi Rendah yang Dioptimalkan untuk Klaster RDMA/HPC/AI pada 200Gb/s HDR

1. Latar Belakang Proyek & Analisis Persyaratan

Seiring klaster HPC dan AI terus berkembang, beban kerja pelatihan terdistribusi dan simulasi ilmiah menuntut bandwidth jaringan, latensi, dan skalabilitas yang semakin ketat. Namun, tidak semua klaster memerlukan infrastruktur 400Gb/s NDR—sejumlah besar lingkungan produksi sudah distandarisasi pada 200Gb/s HDR dan mencari peningkatan kinerja dalam anggaran yang terkontrol. Persyaratan umum meliputi:

  • Latensi rendah yang deterministik: Komunikasi kolektif MPI harus mempertahankan penundaan port-ke-port di bawah mikrodetik, mencegah latensi ekor memengaruhi konvergensi pelatihan.
  • Fabrik tanpa kehilangan: Nol paket hilang di bawah kemacetan untuk memastikan efisiensi RDMA dan menghindari keruntuhan kinerja.
  • Offload komputasi dalam jaringan: Memindahkan operasi kolektif seperti All-Reduce ke fabrik jaringan untuk membebaskan sumber daya CPU/GPU host.
  • Skalabilitas yang mulus: Dukungan untuk ekspansi non-blocking dari ratusan hingga ribuan node, dengan kompatibilitas untuk kabel HDR dan transceiver optik yang ada.

Untuk mengatasi persyaratan ini, solusi ini mengadopsi NVIDIA Mellanox 920-9B110-00FH-0D0 sebagai blok bangunan inti—sakelar InfiniBand 200Gb/s HDR yang menyeimbangkan kinerja, kepadatan, dan efektivitas biaya untuk penerapan skala menengah hingga besar.

2. Desain Arsitektur Jaringan Keseluruhan

Solusi yang diusulkan menggunakan topologi leaf-spine dua tingkat, yang menyediakan fabrik yang dapat diskalakan dan non-blocking dengan latensi yang dapat diprediksi dan pengkabelan yang disederhanakan. Pada lapisan leaf, setiap rak komputasi dilengkapi dengan satu 920-9B110-00FH-0D0 InfiniBand switch OPN (Nomor Pesanan), menawarkan 40 port konektivitas 200Gb/s HDR ke server GPU melalui kabel tembaga direct-attach (DAC) OSFP-ke-OSFP atau kabel optik aktif (AOC). Pada lapisan spine, tingkat kedua sakelar MQM8790-HS2F—platform silikon yang mendasari 920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDR—menghubungkan semua sakelar leaf, menciptakan fabrik fat-tree dengan bandwidth bisection penuh.

Untuk klaster yang lebih besar melebihi 1.500 node, arsitektur folded-Clos tiga tingkat dapat diimplementasikan, dengan 920-9B110-00FH-0D0 berfungsi sebagai leaf dan spine untuk mempertahankan kinerja yang konsisten di semua tingkatan. Tabel berikut merangkum parameter penskalaan utama untuk fabrik HDR 2 tingkat yang dibangun di sekitar sakelar ini:

Komponen Spesifikasi Nilai
Sakelar Leaf 920-9B110-00FH-0D0 1 per rak
Sakelar Spine 920-9B110-00FH-0D0 N/2 (N = jumlah sakelar leaf)
Titik akhir maks Server GPU Hingga 1.600 (radix 40 port)
Bandwidth Bisection Non-blocking penuh 8,0 Tb/s per tingkat spine

3. Peran & Fitur Utama NVIDIA Mellanox 920-9B110-00FH-0D0

Dalam arsitektur ini, NVIDIA Mellanox 920-9B110-00FH-0D0 berfungsi sebagai elemen switching dasar, menyediakan beberapa kemampuan penting:

  • 40 port 200Gb/s HDR: Setiap port OSFP mendukung 200Gb/s dua arah dengan koreksi kesalahan maju (FEC) untuk konektivitas jangkauan yang diperpanjang dan andal.
  • SHARPv2 Terintegrasi (Scalable Hierarchical Aggregation and Reduction Protocol): Memindahkan operasi komunikasi kolektif, mengurangi latensi MPI All-Reduce hingga 30% dalam beban kerja HPC tipikal.
  • Perutean adaptif dan kontrol kemacetan: Secara dinamis mengalihkan lalu lintas untuk menghindari hotspot, memastikan kinerja yang dapat diprediksi di bawah pola lalu lintas yang merugikan.
  • Telemetri lanjutan: Penghitung per aliran dan per port, bersama dengan pemantauan okupansi buffer, memberikan visibilitas mendalam ke kesehatan fabrik.

Menurut lembar data 920-9B110-00FH-0D0, sakelar ini memberikan latensi cut-through di bawah 200ns dan mendukung kapasitas switching agregat hingga 8,0 Tb/s. Spesifikasi 920-9B110-00FH-0D0 juga menyoroti catu daya ganda yang redundan dan modul kipas yang dapat diganti saat panas, memastikan ketersediaan 99,999% untuk beban kerja yang kritis misi.

4. Rekomendasi Penerapan & Skalabilitas

Bagi organisasi yang berencana mengadopsi solusi 920-9B110-00FH-0D0 InfiniBand switch OPN, panduan penerapan berikut direkomendasikan:

  • Strategi pengkabelan: Gunakan kabel DAC OSFP-ke-OSFP untuk koneksi intra-rak (hingga 3m) dan transceiver optik atau AOC untuk tautan antar-rak dan spine-leaf (hingga 100m). Verifikasi bahwa semua kabel kompatibel dengan 920-9B110-00FH-0D0 sesuai matriks kompatibilitas NVIDIA.
  • Redundansi: Terapkan catu daya ganda yang terhubung ke PDU terpisah. Gunakan setidaknya dua sakelar spine per leaf untuk menghilangkan titik kegagalan tunggal.
  • Manajemen firmware: Pastikan semua sakelar menjalankan versi firmware NVIDIA yang identik. Gunakan fitur pembaruan firmware otomatis UFM untuk pembaruan bergulir tanpa downtime.
  • Jalur skalabilitas: Untuk klaster di luar 1.600 node, beralih ke topologi folded-Clos tiga tingkat atau manfaatkan dragonfly+ dengan perutean adaptif. 920-9B110-00FH-0D0 mendukung hingga 64 sakelar dalam satu fabrik di bawah satu manajer subnet.

Saat menghitung total biaya kepemilikan, perhitungkan jumlah tingkat sakelar yang berkurang dan pengkabelan yang disederhanakan dibandingkan dengan alternatif radix yang lebih rendah. Meskipun harga 920-9B110-00FH-0D0 per unit lebih tinggi daripada sakelar EDR (100Gb/s), biaya per port secara signifikan lebih rendah daripada NDR, menjadikannya pilihan optimal untuk penerapan HDR yang sadar biaya.

5. Operasi, Pemantauan & Pemecahan Masalah

Manajemen efektif dari fabrik HDR memerlukan kerangka kerja pemantauan dan pemecahan masalah yang komprehensif. Unified Fabric Manager (UFM) NVIDIA menyediakan satu tampilan tunggal untuk seluruh NVIDIA Mellanox 920-9B110-00FH-0D0, menawarkan:

  • Visualisasi topologi: Penemuan otomatis dan representasi grafis dari semua sakelar, tautan, dan titik akhir.
  • Dasbor kinerja: Tampilan real-time dari utilisasi port, tingkat kesalahan, dan indikator kemacetan.
  • Peringatan proaktif: Alarm berbasis ambang batas untuk degradasi tautan, anomali suhu, dan kegagalan catu daya.
  • Isolasi kesalahan: Alur kerja pemecahan masalah terpandu yang mengidentifikasi kabel, transceiver, atau port sakelar yang rusak.

Untuk pemecahan masalah lanjutan, manfaatkan alat diagnostik bawaan sakelar, termasuk pengujian loopback dan analisis BER (bit error rate), untuk memvalidasi integritas tautan sebelum menerapkan beban kerja produksi. Masalah umum yang ditemui dalam penerapan awal termasuk perutean suboptimal yang disebabkan oleh kecepatan tautan yang tidak setara atau jenis kabel yang tidak cocok. Mengaktifkan perutean adaptif dan memverifikasi bahwa semua tautan beroperasi pada 200Gb/s (dengan FEC diaktifkan) menyelesaikan sebagian besar anomali kinerja. 920-9B110-00FH-0D0 InfiniBand switch OPN juga mendukung konfigurasi manajer subnet yang redundan, memastikan konfigurasi ulang fabrik terjadi tanpa intervensi manual jika terjadi kegagalan node manajemen.

6. Ringkasan & Penilaian Nilai

920-9B110-00FH-0D0 memberikan proposisi nilai yang menarik bagi organisasi yang membangun atau memperluas klaster HPC dan AI berbasis HDR. Ini menyediakan 40 port 200Gb/s HDR dengan latensi di bawah 200ns, offload SHARPv2, dan kemudahan pengelolaan kelas perusahaan—semuanya dalam platform 1U yang hemat biaya. Poin nilai utama meliputi:

  • Kinerja: Pengurangan waktu penyelesaian pekerjaan hingga 35% untuk beban kerja yang intensif komunikasi melalui offload SHARPv2 dan perutean adaptif.
  • Efisiensi biaya: TCO lebih rendah dibandingkan alternatif NDR, dengan biaya per port yang dioptimalkan untuk penerapan skala HDR.
  • Kesederhanaan operasional: Integrasi mendalam dengan UFM untuk manajemen terpadu, pemantauan proaktif, dan failover otomatis.
  • Perlindungan investasi: Kompatibilitas penuh dengan kabel, optik, dan tumpukan perangkat lunak HDR yang ada, memungkinkan peningkatan bertahap tanpa mengganggu produksi.

Bagi organisasi yang mengevaluasi 920-9B110-00FH-0D0 untuk dijual melalui mitra saluran NVIDIA, kami merekomendasikan untuk meninjau lembar data 920-9B110-00FH-0D0 yang terperinci dan melibatkan arsitek solusi bersertifikat untuk memvalidasi desain untuk beban kerja dan persyaratan skala spesifik Anda. NVIDIA Mellanox 920-9B110-00FH-0D0 siap produksi hari ini, menawarkan fondasi interkoneksi berkinerja tinggi yang seimbang untuk inovasi HPC dan AI generasi berikutnya.