NVIDIA Mellanox 920-9B210-00FN-0D0 dalam Praktik: Membangun Fabric Latensi Rendah NDR untuk Klaster AI Triliunan Parameter
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 dalam Praktik: Membangun Fabric Latensi Rendah NDR untuk Klaster AI Triliunan Parameter
Latar Belakang & Tantangan: Saat HDR Bertemu Model Triliunan Parameter
Sebuah organisasi riset AI terkemuka baru-baru ini meningkatkan skala klaster pelatihan model bahasa besarnya dari 1.024 menjadi 4.096 GPU NVIDIA H100, dengan tujuan mempersingkat linimasa pelatihan model MoE (Mixture of Experts) jarang 1,8 triliun parameter dari berbulan-bulan menjadi di bawah dua minggu. Namun, selama validasi awal, tim mengamati kemacetan parah dalam fase komunikasi all-to-all pada fabric HDR 200Gb/s yang ada, menyebabkan utilisasi GPU anjlok dari perkiraan 85% menjadi hanya 52%—jauh di bawah ambang batas yang diperlukan untuk memenuhi tenggat waktu pelatihan ambisius mereka.
Analisis jaringan mengungkapkan bahwa operasi kolektif all-to-all, yang melekat pada arsitektur MoE, menjenuhkan tautan HDR dan memicu mekanisme kontrol kemacetan yang semakin memperparah latensi. Organisasi tersebut membutuhkan fabric yang dapat memberikan latensi deterministik di bawah mikrodetik di ribuan titik akhir sambil menyediakan ruang kepala bandwidth untuk menyerap lonjakan lalu lintas tanpa keruntuhan kinerja. Inilah tepatnya tantangan yang dihadapi oleh NVIDIA Mellanox 920-9B210-00FN-0D0 dirancang untuk mengatasinya.
Solusi & Penerapan: Fabric NDR 400Gb/s untuk AI Skala Exa
Organisasi tersebut menerapkan 920-9B210-00FN-0D0 InfiniBand switch OPN (Nomor Pesanan) sebagai fondasi fabric leaf-spine dua tingkat yang baru. Pada lapisan leaf, setiap rak menerima dua switch 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR, menyediakan 128 port konektivitas 400Gb/s ke 64 server H100 dual-port per rak melalui kabel optik aktif OSFP-ke-OSFP. Pada lapisan spine, 16 switch 920-9B210-00FN-0D0 tambahan menghubungkan semua switch leaf, menciptakan fat-tree non-blocking dengan bandwidth biseksi penuh 51,2 Tb/s per tingkat spine.
Apa yang membuat solusi ini sangat menarik adalah teknologi SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) yang terintegrasi pada switch. Untuk beban kerja MoE, komunikasi all-to-all dialihkan langsung ke fabric switch, dengan switch melakukan pengurangan dan redistribusi data dalam jaringan. Ini menghilangkan kebutuhan untuk beberapa lintasan di sisi host, secara dramatis mengurangi overhead komunikasi yang telah menghantui penerapan HDR sebelumnya.
Menurut datasheet 920-9B210-00FN-0D0, switch ini memberikan latensi cut-through di bawah 100ns, yang divalidasi selama fase proof-of-concept. Tim teknik juga mengonfirmasi bahwa ekosistem 920-9B210-00FN-0D0 kompatibel mencakup semua optik dan kabel OSFP yang telah mereka kualifikasi, menghilangkan penundaan pengadaan. Spesifikasi 920-9B210-00FN-0D0—termasuk catu daya dual-redundant dan kipas yang dapat diganti saat panas—memberikan kepercayaan diri kepada tim untuk mencapai target ketersediaan 99,999% untuk klaster produksi.
Hasil & Peningkatan Terukur: Dari Hambatan Menjadi Pendorong
Setelah fabric NDR penuh diterapkan dan pekerjaan pelatihan MoE dimulai kembali, organisasi mengukur peningkatan transformatif di berbagai dimensi:
- Pemulihan utilisasi GPU: Utilisasi GPU rata-rata melonjak dari 52% menjadi 89%, dengan utilisasi puncak mencapai 94% selama fase intensif komputasi—hasil langsung dari penghapusan jeda yang disebabkan oleh jaringan.
- Pengurangan latensi all-to-all: Waktu yang dibutuhkan untuk pertukaran all-to-all penuh di 4.096 GPU turun dari 180ms menjadi di bawah 45ms, peningkatan 75% yang secara langsung diterjemahkan menjadi iterasi pelatihan yang lebih cepat.
- Waktu penyelesaian pekerjaan: Linimasa pelatihan yang diproyeksikan untuk model MoE 1,8T dikurangi dari 14 hari menjadi hanya 9 hari—akselerasi 36% yang secara signifikan mengurangi biaya waktu-ke-pasar dan komputasi cloud.
- Efisiensi operasional: Dengan 64 port per switch, jumlah switch spine yang dibutuhkan berkurang 37% dibandingkan dengan desain HDR 40-port, menyederhanakan pengkabelan dan mengurangi konsumsi daya per rak sebesar 28%.
Dari perspektif total biaya kepemilikan, tim keuangan organisasi mencatat bahwa meskipun harga 920-9B210-00FN-0D0 per unit lebih tinggi daripada alternatif HDR, biaya jaringan per-GPU sebenarnya menurun karena radiks yang lebih tinggi dan jumlah lapisan switch yang berkurang. Keunggulan ekonomi ini, dikombinasikan dengan peningkatan kinerja yang dramatis, menjadikan peningkatan NDR sebagai kemenangan bisnis yang jelas. Solusi OPN switch InfiniBand 920-9B210-00FN-0D0 juga terintegrasi dengan mulus dengan penerapan NVIDIA UFM yang ada, menyediakan visibilitas terpusat dan peringatan otomatis yang mengurangi overhead operasional sebesar 40%.
Ringkasan & Prospek: Fondasi NDR untuk AI Generasi Berikutnya
NVIDIA Mellanox 920-9B210-00FN-0D0 terbukti menjadi solusi transformatif yang dibutuhkan organisasi riset AI ini untuk membuka potensi penuh klaster H100 4.096-GPU-nya. Dengan memberikan bandwidth NDR 400Gb/s, kepadatan 64-port, dan komputasi dalam jaringan SHARPv3, switch ini memungkinkan mereka untuk meningkatkan skala dari 1.024 menjadi 4.096 GPU tanpa mengorbankan kinerja atau kemudahan pengelolaan—sebuah pencapaian yang tidak mungkin dilakukan dengan infrastruktur HDR sebelumnya.
Ke depan, organisasi berencana untuk berekspansi ke 8.192 GPU dalam 18 bulan ke depan, memanfaatkan 920-9B210-00FN-0D0 untuk dijual melalui mitra saluran NVIDIA untuk membangun fabric folded-Clos tiga tingkat yang lebih besar. Bagi organisasi yang mengevaluasi investasi jaringan AI dan HPC generasi berikutnya, 920-9B210-00FN-0D0 menawarkan solusi yang terbukti dan siap produksi yang memenuhi janji optimasi interkoneksi RDMA latensi rendah pada skala exa.

