Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch dalam praktek

July 15, 2026

berita perusahaan terbaru tentang Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch dalam praktek

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch dalam Praktek | Optimasi Interkoneksi Latensi Rendah untuk Cluster RDMA/HPC/AI

Latar Belakang & Tantangan: Ketika Skala Cluster Memenuhi Hambatan Interkoneksi

Divisi riset AI sebuah perusahaan internet terkemuka berada di persimpangan jalan yang sudah tidak asing lagi. Armada server GPU mereka yang terus bertambah—mencakup banyak rak dan semakin banyak digunakan untuk pelatihan model bahasa berskala besar—mengalami waktu penyelesaian pekerjaan yang tidak dapat diprediksi. Fabric berbasis Ethernet yang ada, meskipun memadai untuk beban kerja tujuan umum, tidak dapat menangani pola lalu lintas pelatihan terdistribusi yang tersinkronisasi dan meledak-ledak. Operasi pengurangan semua akan sering terhenti karena penurunan paket dan kemacetan incast, mendorong siklus pelatihan dari hari ke minggu. Tim infrastruktur memerlukan perubahan mendasar dalam cara jaringan backend mereka menangani lalu lintas RDMA, dan mereka memerlukannya tanpa merombak seluruh arsitektur pusat data mereka.

Desain Solusi: Menerapkan OPN Switch InfiniBand 920-9B210-00FN-0D0

Setelah mengevaluasi beberapa opsi interkoneksi, tim memilihMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0sebagai landasan struktur backend baru mereka. Penerapannya berpusat pada topologi tulang daun dua tingkat, dengan masing-masing saklar daun menghubungkan hingga 40 node GPU melalui tautan 400 Gb/s. Itu920-9B210-00FN-0D0 MQM9790-NS2F 400 Gb/dtk NDRvarian dipilih secara khusus karena arsitektur non-pemblokiran dan kemampuan komputasi dalam jaringan SHARPv3 yang terintegrasi. Hal ini memungkinkan tim untuk memindahkan operasi komunikasi kolektif langsung ke switch fabric, mengurangi overhead CPU dan membebaskan siklus GPU untuk komputasi sebenarnya.

Dalam hal penerapan fisik, sakelar dipasang dengan aliran udara dari depan ke belakang agar sesuai dengan konfigurasi lorong panas/lorong dingin yang ada. Tim memanfaatkanLembar data 920-9B210-00FN-0D0untuk memverifikasi kebutuhan daya dan pendinginan, memastikan integrasi yang lancar ke unit distribusi daya yang ada. Pengkabelan tetap konsisten menggunakan transceiver QSFP-DD, denganKompatibel dengan 920-9B210-00FN-0D0optik divalidasi di seluruh link budget, termasuk koneksi tulang-ke-daun yang membentang hingga 100 meter.

Pendekatan Penerapan: Integrasi Langkah demi Langkah

  • Fase 1 – Validasi Lab:Testbed skala kecil dengan 8 node GPU dan dua switch digunakan untuk mengukur latensi dan throughput. ItuNVIDIA Mellanox 920-9B210-00FN-0D0mendemonstrasikan latensi peralihan sub-600ns, peningkatan 60% dibandingkan generasi HDR sebelumnya.
  • Fase 2 – Peluncuran Bertahap:Tim memigrasikan pod pelatihan satu per satu, menggunakan Unified Fabric Manager NVIDIA untuk memantau kesehatan link dan metrik kemacetan secara real-time. Hal ini meminimalkan gangguan terhadap beban kerja produksi yang sedang berlangsung.
  • Fase 3 – Integrasi Skala Penuh:Ke-18 sakelar ditempatkan di tiga rak, membentuk tulang belakang yang sepenuhnya tidak menghalangi dengan uplink 400 Gb/s. Perutean adaptif diaktifkan untuk menyeimbangkan lalu lintas secara dinamis dan menghindari kelebihan permintaan selama puncak penyerahan pekerjaan.

Sepanjang penerapan, tim teknik mengacu pada komprehensifSpesifikasi 920-9B210-00FN-0D0untuk menyempurnakan pengaturan buffer dan parameter kontrol kemacetan. Telemetri canggih dari switch ini memberikan visibilitas terperinci mengenai jumlah kesalahan per port dan pemanfaatan tautan, sehingga memungkinkan pemeliharaan proaktif dan perencanaan kapasitas.

Hasil Terukur & Manfaat Operasional

Dalam waktu dua minggu setelah penerapan skala penuh, kemajuan terlihat nyata. Waktu penyelesaian semua pengurangan untuk tugas pelatihan standar 1.024 GPU turun dari 12,3 detik menjadi 7,8 detik, yang berarti pengurangan overhead komunikasi sebesar 37%. Waktu penyelesaian tugas untuk model gaya GPT pada umumnya meningkat hampir 30%, sehingga tim peneliti dapat melakukan iterasi lebih cepat dan menjalankan lebih banyak eksperimen per minggu. Mesin SHARPv3 bawaan mampu meringankan rata-rata 18% operasi kolektif, yang secara langsung berarti penggunaan GPU yang lebih tinggi dan konsumsi energi yang lebih rendah per proses pelatihan.

Secara operasional, tim TI melaporkan lebih sedikit kegagalan pekerjaan terkait jaringan dan secara signifikan lebih sedikit waktu yang dihabiskan untuk mendiagnosis masalah tingkat tautan. Itu920-9B210-00FN-0D0 solusi OPN sakelar InfiniBandterbukti sangat stabil, tanpa adanya pemadaman yang tidak direncanakan selama periode pengamatan tiga bulan. Antarmuka manajemen terpadu mengurangi kurva pembelajaran bagi tim operasi jaringan, yang kini dapat mengelola seluruh struktur melalui satu panel kaca.

Pertimbangan Biaya dan Pengadaan

Sedangkan awalnyaHarga 920-9B210-00FN-0D0menempatkan peralihan di pasar premium, analisis total biaya kepemilikan menceritakan kisah yang berbeda. Dengan mengurangi waktu penyelesaian pekerjaan dan meningkatkan pemanfaatan GPU, organisasi mencapai pengurangan biaya instans cloud sebesar 22% untuk kapasitas komputasi yang setara. Selain itu,920-9B210-00FN-0D0 untuk dijualmelalui beberapa mitra saluran memungkinkan penawaran yang kompetitif, dan komitmen dukungan jangka panjang dari NVIDIA Mellanox memberikan kepercayaan pada investasi.

Ringkasan & Pandangan: Cetak Biru untuk Infrastruktur AI Generasi Berikutnya

PenyebaranMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0di fasilitas penelitian AI berskala besar ini berfungsi sebagai arsitektur referensi yang menarik bagi organisasi yang menghadapi tantangan interkoneksi serupa. Kombinasi kecepatan NDR 400 Gb/s, latensi sub-mikrodetik, dan kemampuan komputasi dalam jaringan mengatasi permasalahan inti dari cluster HPC dan AI berbasis RDMA. Arsitek jaringan akan menghargai fleksibilitasnya920-9B210-00FN-0D0 Sakelar InfiniBand OPNdalam berbagai topologi, sementara manajer TI dapat mengandalkan alat manajemen yang kuat dan komprehensifLembar data 920-9B210-00FN-0D0untuk perencanaan kapasitas.

Ke depan, organisasi ini sudah berencana memperluas jaringannya untuk mendukung cluster GPU yang lebih besar, termasuk integrasi DPU BlueField-3 untuk pembongkaran penyimpanan tambahan dan isolasi keamanan. ItuKompatibel dengan 920-9B210-00FN-0D0ekosistem memastikan bahwa peningkatan di masa depan—baik NIC yang lebih baru atau teknologi optik—akan didukung dengan lancar. Bagi perusahaan mana pun yang menerapkan beban kerja AI atau HPC berskala besar, peralihan ini tidak hanya mewakili peningkatan bertahap namun juga faktor fundamental yang mendukung kinerja dalam skala besar.