NVIDIA Mellanox 920-9B110-00FH-0D0 dalam Praktik: Mengoptimalkan Low-Latency RDMA Fabrics untuk HPC dan AI Cluster
August 25, 2026
NVIDIA Mellanox 920-9B110-00FH-0D0 dalam Praktik: Mengoptimalkan Low-Latency RDMA Fabrics untuk HPC dan AI Cluster
Latar Belakang & Tantangan: Ketika Kinerja HDR Bertemu Realitas Anggaran
Sebuah laboratorium penelitian AI berukuran sedang baru-baru ini menghadapi tantangan yang akrab: kain EDR InfiniBand 100Gb / s yang ada menjadi kemacetan untuk kluster GPU yang berkembang,yang telah tumbuh dari 128 ke 512 NVIDIA A100 nodeWaktu pelatihan untuk model trafo skala besar meningkat lebih dari 40% karena kemacetan jaringan selama operasi semua-reducer,dan tim membutuhkan peningkatan yang dapat memberikan keuntungan kinerja yang substansial tanpa pengeluaran modal yang diperlukan untuk penyebaran NDR 400Gb / s penuh.
Laboratorium mengevaluasi beberapa pilihan dan mengidentifikasi HDR 200Gb / s sebagai keseimbangan kinerja dan biaya yang ideal.kontrol kemacetan lanjutan, dan integrasi yang mulus dengan kabel dan transceiver yang kompatibel HDR yang ada.NVIDIA Mellanox 920-9B110-00FH-0D0masuk ke dalam gambar switch khusus dibangun untuk lingkungan di mana HDR menyediakan bandwidth yang cukup tanpa overprovisioning.
Solusi & Penerapan: Kain HDR yang Dioptimalkan Biaya
Laboratorium mengerahkan920-9B110-00FH-0D0 InfiniBand switch OPN(Ordering Part Number) sebagai landasan dari arsitektur leaf-spine baru mereka.920-9B110-00FH-0D0 MQM8790-HS2F¢ menyediakan 40 port konektivitas 200Gb/s ke server GPU melalui kabel OSFP-to-OSFP direct-attach.menciptakan kain pohon lemak yang tidak menghalangi dengan lebar pita bisection penuh.
Yang membuat penyebaran ini sangat efektif adalah teknologi SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol) yang terintegrasi,yang langsung melakukan operasi komunikasi kolektif ke jaringan switchDalam praktiknya, ini berarti bahwa operasi semua-mengurangi, yang sebelumnya mengkonsumsi siklus CPU host yang signifikan dan bandwidth jaringan,sekarang selesai dalam satu langkah di seluruh kain, secara dramatis mengurangi waktu penyelesaian pekerjaan.
MenurutData sheet 920-9B110-00FH-0D0, switch memberikan sub-200ns cut-through latency, yang selaras erat dengan persyaratan kinerja laboratorium.920-9B110-00FH-0D0 kompatibelSistem ekosistem mencakup semua jenis kabel dan optik yang telah mereka standarkan, menghilangkan kebutuhan untuk upaya kabel ulang yang mahal.
Hasil & Keuntungan yang Dapat Diukur: Dari Botol Ke Enabler
Setelah penyebaran, laboratorium mengukur peningkatan di beberapa dimensi kritis:
- Pengurangan waktu penyelesaian pekerjaan:Iterasi pelatihan untuk model 13B-parameter berkurang sebesar 35%, dengan latensi semua-mengurangi turun dari 12μs menjadi kurang dari 5μs untuk ukuran kolektif khas.
- Penggunaan jaringan:Rata-rata pemanfaatan kain meningkat dari 58% menjadi 83% tanpa memicu kemacetan, berkat mekanisme routing adaptif dan kontrol kemacetan switch.
- Efisiensi daya dan pendinginan:Dibandingkan dengan kain EDR sebelumnya, infrastruktur HDR baru mengurangi konsumsi daya per port sebesar 30%, memungkinkan laboratorium untuk menambahkan lebih banyak node komputasi tanpa melebihi anggaran daya pusat data mereka.
Dari perspektif total biaya kepemilikan,920-9B110-00FH-0D0 hargaPer port secara signifikan lebih rendah daripada alternatif NDR, memungkinkan laboratorium untuk meningkatkan seluruh struktur mereka dalam anggaran mereka yang ada.Spesifikasi 920-9B110-00FH-0D0juga menyoroti sumber daya dual redundant switch dan modul kipas yang dapat ditukar panas, yang berkontribusi pada tujuan laboratorium untuk ketersediaan 99,999% untuk pekerjaan pelatihan produksi mereka.
Insinyur jaringan mencatat bahwa920-9B110-00FH-0D0 InfiniBand switch solusi OPNterintegrasi dengan mulus dengan Unified Fabric Manager (UFM) NVIDIA, memberikan visibilitas terpusat ke kesehatan kain dan peringatan otomatis.Ini secara signifikan mengurangi waktu yang dihabiskan untuk pemecahan masalah dan pemeliharaan proaktif, membebaskan tim untuk fokus pada pengoptimalan pipa pelatihan mereka daripada mengelola jaringan.
Ringkasan & Prospek: Yayasan HDR Berukuran Tepat
PeraturanNVIDIA Mellanox 920-9B110-00FH-0D0terbukti menjadi pilihan yang tepat untuk laboratorium penelitian ini, memberikan kinerja 200Gb / s HDR pada struktur biaya yang masuk akal untuk bisnis.kemampuan komputasi dalam jaringan, dan fitur manajemen yang kuat, laboratorium mengubah jaringan mereka dari kemacetan kinerja menjadi dasar yang dapat diskalakan untuk pertumbuhan di masa depan.
Melihat ke depan, laboratorium berencana untuk meningkatkan cluster mereka menjadi 1.024 node dalam 18 bulan ke depan.mereka yakin bahwa jaringan mereka dapat tumbuh bersama dengan kapasitas komputasi merekaUntuk organisasi yang mengevaluasi pilihan infrastruktur HDR mereka,920-9B110-00FH-0D0 dijualmelalui mitra saluran NVIDIA menawarkan solusi yang menarik, produksi-divalidasi yang menyeimbangkan kinerja, kepadatan, dan biaya.

