NVIDIA Mellanox 920-9B210-00FN-0D0 dalam Praktik: Membangun Fabric Latensi Rendah NDR untuk Model MoE Triliunan Parameter

August 27, 2026

berita perusahaan terbaru tentang NVIDIA Mellanox 920-9B210-00FN-0D0 dalam Praktik: Membangun Fabric Latensi Rendah NDR untuk Model MoE Triliunan Parameter

NVIDIA Mellanox 920-9B210-00FN-0D0 dalam Praktik: Membangun Fabric Latensi Rendah NDR untuk Model MoE Triliunan Parameter

Latar Belakang & Tantangan: Ketika Komunikasi All-to-All Menjadi Bottleneck Pelatihan

Sebuah organisasi riset AI terkemuka baru-baru ini meningkatkan skala kluster pelatihan model bahasa besarnya dari 1.024 menjadi 4.096 GPU NVIDIA H100, dengan tujuan ambisius untuk mengurangi waktu pelatihan model MoE (Mixture of Experts) jarang dengan 1,8 triliun parameter dari berbulan-bulan menjadi di bawah dua minggu. Namun, selama validasi awal, tim menemukan bahwa jaringan HDR 200Gb/s yang ada mengalami kemacetan parah selama fase komunikasi all-to-all—pola karakteristik arsitektur MoE—menyebabkan utilisasi GPU anjlok dari perkiraan 85% menjadi hanya 52%, jauh di bawah ambang batas yang diperlukan untuk memenuhi tenggat waktu pelatihan mereka.

Analisis jaringan mengungkapkan bahwa komunikasi kolektif all-to-all menyumbang lebih dari 40% jejak komunikasi model MoE, dan seiring dengan peningkatan jumlah pakar, pola lalu lintas menjadi semakin terfragmentasi dan berdenyut. Jaringan HDR yang ada, setelah memicu mekanisme kontrol kemacetan, mengalami peningkatan latensi ekor yang dramatis, meninggalkan sebagian besar GPU menganggur dan menunggu. Organisasi tersebut sangat membutuhkan fabric jaringan yang mampu memberikan latensi deterministik sub-mikrodetik, transportasi tanpa kehilangan, dan skalabilitas non-blocking masif—dan NVIDIA Mellanox 920-9B210-00FN-0D0 dibangun khusus untuk tantangan ini.

Solusi & Penerapan: Arsitektur Leaf-Spine NDR yang Dioptimalkan untuk MoE

Organisasi tersebut menerapkan fabric leaf-spine dua tingkat yang dibangun di sekitar 920-9B210-00FN-0D0 InfiniBand switch OPN. Di setiap rak komputasi, dua switch 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR diterapkan pada lapisan leaf, menyediakan konektivitas 400Gb/s ke 64 server H100 dual-port melalui kabel optik aktif OSFP-ke-OSFP. Pada lapisan spine, 16 switch 920-9B210-00FN-0D0 tambahan menghubungkan semua switch leaf, menciptakan fabric fat-tree yang sepenuhnya non-blocking dengan bandwidth bisection agregat 51,2 Tb/s.

Inti dari solusi ini adalah teknologi SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) yang terintegrasi pada switch. Untuk beban kerja MoE, komunikasi all-to-all dialihkan langsung ke fabric switch, dengan switch melakukan pengurangan dan redistribusi data di dalam jaringan. Hal ini menghilangkan kebutuhan akan beberapa lintasan di sisi host, secara dramatis mengurangi overhead komunikasi yang telah menghantui penerapan HDR sebelumnya. datasheet 920-9B210-00FN-0D0 menyoroti latensi cut-through di bawah 100ns, yang divalidasi selama fase proof-of-concept dan terbukti penting untuk persyaratan latensi ketat beban kerja MoE.

spesifikasi 920-9B210-00FN-0D0—termasuk catu daya ganda redundan dan kipas yang dapat diganti saat panas—memberikan kepercayaan diri kepada tim dalam mencapai target ketersediaan 99,999%. Tim teknik juga mengonfirmasi bahwa ekosistem 920-9B210-00FN-0D0 kompatibel mencakup semua optik dan kabel OSFP yang telah mereka kualifikasi, menghilangkan penundaan pengadaan dan menyederhanakan jadwal penerapan.

Hasil & Peningkatan Terukur: Dari Bottleneck Menjadi Enabler

Setelah fabric NDR sepenuhnya diterapkan dan pekerjaan pelatihan MoE dimulai kembali, organisasi mengukur peningkatan transformatif di berbagai dimensi:

  • Pemulihan utilisasi GPU: Utilisasi GPU rata-rata melonjak dari 52% menjadi 89%, dengan utilisasi puncak mencapai 94% selama fase intensif komputasi—hasil langsung dari penghapusan jeda yang disebabkan oleh jaringan.
  • Pengurangan latensi all-to-all: Waktu yang dibutuhkan untuk pertukaran all-to-all penuh di 4.096 GPU turun dari 180ms menjadi di bawah 45ms, peningkatan 75% yang secara langsung diterjemahkan menjadi iterasi pelatihan yang lebih cepat.
  • Waktu penyelesaian pekerjaan: Jadwal pelatihan yang diproyeksikan untuk model MoE 1,8T dikurangi dari 14 hari menjadi hanya 9 hari—akselerasi 36% yang secara signifikan memotong waktu-ke-pasar dan biaya komputasi cloud.
  • Efisiensi operasional: Dengan 64 port per switch, jumlah switch spine yang dibutuhkan berkurang 37% dibandingkan dengan desain HDR 40-port, menyederhanakan pengkabelan dan mengurangi konsumsi daya per rak sebesar 28%.

Dari perspektif total biaya kepemilikan, tim keuangan organisasi mencatat bahwa meskipun harga 920-9B210-00FN-0D0 per unit lebih tinggi daripada alternatif HDR, biaya jaringan per-GPU sebenarnya menurun karena radiks yang lebih tinggi dan jumlah lapisan switch yang berkurang. Keunggulan ekonomi ini, dikombinasikan dengan peningkatan kinerja yang dramatis, menjadikan peningkatan NDR sebagai kemenangan bisnis yang jelas. solusi 920-9B210-00FN-0D0 InfiniBand switch OPN juga terintegrasi mulus dengan penerapan NVIDIA UFM yang ada, menyediakan visibilitas terpusat dan peringatan otomatis yang mengurangi overhead operasional sebesar 40%.

Ringkasan & Prospek: Fondasi NDR untuk Beban Kerja MoE Generasi Berikutnya

NVIDIA Mellanox 920-9B210-00FN-0D0 terbukti menjadi solusi transformatif yang dibutuhkan organisasi riset AI ini untuk membuka potensi penuh kluster H100 4.096-GPU mereka. Dengan menyediakan bandwidth NDR 400Gb/s, kepadatan 64-port, dan komputasi di dalam jaringan SHARPv3, switch memungkinkan mereka untuk meningkatkan skala dari 1.024 menjadi 4.096 GPU tanpa mengorbankan kinerja atau kemudahan pengelolaan—sebuah pencapaian yang tidak mungkin dilakukan dengan infrastruktur HDR mereka sebelumnya.

Ke depan, organisasi berencana untuk berekspansi ke 8.192 GPU dalam 18 bulan ke depan, memanfaatkan 920-9B210-00FN-0D0 untuk dijual melalui mitra saluran NVIDIA untuk membangun fabric folded-Clos tiga tingkat yang lebih besar. Bagi organisasi yang mengevaluasi investasi jaringan AI dan HPC generasi berikutnya, 920-9B210-00FN-0D0 menawarkan solusi yang terbukti dan siap produksi yang memenuhi janji optimasi interkoneksi RDMA latensi rendah pada skala exascale.