NVIDIA Mellanox MCX653105A-HDAT dalam Aksi: RDMA/RoCE Low-Latency Transport dan Server Throughput Optimization

July 29, 2026

berita perusahaan terbaru tentang NVIDIA Mellanox MCX653105A-HDAT dalam Aksi: RDMA/RoCE Low-Latency Transport dan Server Throughput Optimization

NVIDIA Mellanox MCX653105A-HDAT dalam Aksi: RDMA/RoCE Low-Latency Transport dan Server Throughput Optimization

Latar Belakang & Tantangan: Botol Jaringan di Kluster AI/HPC

Sebuah perusahaan teknologi besar baru-baru ini menerapkan 128 node GPU-accelerated cluster untuk pelatihan model bahasa besar (LLM),dengan setiap node dilengkapi dengan delapan GPU NVIDIA H100 dan penyimpanan NVMe berkinerja tinggiNamun, setelah skala di luar 32 node, cluster mengalami degradasi kinerja yang dramatis.sementara TCP/IP jaringan tumpukan dikonsumsi lebih dari 45% dari sumber daya CPU per nodeJaringan yang dibangun pada beberapa link 25GbE telah menjadi hambatan utama, sangat membatasi pemanfaatan GPU dan memperpanjang siklus pelatihan jauh di luar garis waktu yang dapat diterima.Tim mendesak membutuhkan solusi yang mampu memberikan latensi ultra-rendah dan bandwidth besar sementara offloading CPU-intensif pemrosesan jaringan.

Solusi & Penerapan: Mengubah Kain dengan MCX653105A-HDAT

Setelah evaluasi teknis yang komprehensif, tim memilihNVIDIA Mellanox MCX653105A-HDATSetiap node GPU dilengkapi denganMCX653105A-HDAT ConnectX adaptor kartu jaringan PCIe, dikonfigurasi dengan konektivitas 100GbE dual-port untuk menyediakan 200 Gb/s bandwidth agregat per server.

Penempatan dilakukan dalam empat fase terstruktur:

  • Fase 1 Setiap server menerimaKartu adaptor Ethernet MCX653105A-HDATAdaptor ini dipasang dengan firmware terbaru dan tumpukan driver NVIDIA OFED.
  • Fase 2 RoCEv2 Konfigurasi:Tim mengaktifkan RoCEv2 di seluruh jaringan, dengan hati-hati menyesuaikan parameter Priority Flow Control (PFC) dan Explicit Congestion Notification (ECN) untuk membangun lingkungan Ethernet tanpa kerugian.Fitur-fitur manajemen kemacetan lanjutan yang terperinci dalamLembar data MCX653105A-HDATberperan penting dalam mencapai alokasi buffer yang optimal.
  • Fase 3 Optimasi NCCL:NVIDIA Collective Communications Library (NCCL) dikonfigurasi ulang untuk memanfaatkan kemampuan RDMA adaptor,dengan aturan kemudi lalu lintas khusus yang diprogram ke dalam mesin pemrosesan tertanam adaptor untuk mengoptimalkan pola khusus semua mengurangi dan semua mengumpulkan beban kerja LLM.
  • Tahap 4 Validasi & Penyetelan:Menggunakan data telemetri yang terkena melaluiSpesifikasi MCX653105A-HDAT, tim memvalidasi konfigurasi, menyesuaikan pengaturan moderasi gangguan, dan menetapkan metrik kinerja dasar untuk pemantauan berkelanjutan.

Khususnya, adaptor terbuktiMCX653105A-HDAT kompatibeldengan infrastruktur kabel yang ada, karena port QSFP28 mendukung optik 100GbE dan 25GbE, memungkinkan migrasi yang halus tanpa penggantian kabel yang mengganggu.Tim juga memanfaatkan kemampuan multi-host adaptor untuk mendukung fungsi komputasi dan penyimpanan pada port fisik yang sama.

Hasil & Manfaat: Keuntungan Terukur dalam Kinerja Pelatihan

Peningkatan kinerja yang dicapai olehNVIDIA Mellanox MCX653105A-HDATMetrik kinerja utama sebelum dan setelah upgrade diringkas di bawah ini:

Metrik Pra-Upgrade (25GbE TCP/IP) Post-Upgrade (MCX653105A-HDAT dengan RoCE) Peningkatan
All-Reduce Latency (128 node) 9.2 ms 0.28 ms 32.8 × pengurangan
Penggunaan CPU jaringan (per node) 47% 6% 41 pp diregenerasi
Penggunaan GPU (fase pelatihan) 58% 94% +36% peningkatan
Hasil Pelatihan Cluster 1.9x garis dasar 5.7x garis dasar 3x peningkatan

Di luar prestasi kuantitatif ini, tim mengamati manfaat operasional yang signifikan.mempercepat secara dramatis siklus iterasi modelAdaptor yang dapat diprogram data-path memungkinkan kustom traffic shaping untuk aliran prioritas, memastikan bahwa kritis lalu lintas komunikasi kolektif tidak pernah mengalami perselisihan.Untuk organisasi yang menilai laba atas investasi, yangHarga MCX653105A-HDATterbukti sepenuhnya dibenarkan oleh keuntungan throughput 3× dan kemampuan untuk menunda akuisisi server GPU tambahan setidaknya 12 bulan.MCX653105A-HDAT untuk dijualbundel dengan switch NVIDIA Spectrum-4 menawarkan ekonomi yang paling menguntungkan untuk penyebaran cluster penuh.

Ringkasan & Prospek: Yayasan untuk Infrastruktur AI Generasi Berikutnya

Pengembangan skala produksi ini memvalidasi bahwaNVIDIA Mellanox MCX653105A-HDATadalah komponen transformatif untuk modern AI dan HPC cluster. kombinasi 200 Gb / s aggregate bandwidth, sub-0.3 millisecond latency komunikasi kolektif,dan hardware offloads komprehensif memungkinkan organisasi untuk mencapai skala hampir linier untuk beban kerja GPU dipercepat. Sebagai ujung ke ujungSolusi kartu adaptor MCX653105A-HDAT Ethernet, itu menghilangkan kemacetan jaringan yang secara historis membatasi efisiensi pelatihan terdistribusi.

Menatap ke depan, perusahaan sedang mengeksplorasi integrasi dengan NVIDIA DOCA untuk menerapkan pemrograman jalur data tambahan untuk pengoptimalan beban kerja tertentu.Mereka juga memanfaatkan telemetry canggih adaptor yang didokumentasikan secara ekstensif dalamLembar data MCX653105A-HDATUntuk membangun model kinerja prediktif dan strategi mitigasi kemacetan otomatis.NVIDIA Mellanox MCX653105A-HDATtelah menjadi landasan dari peta jalan infrastruktur AI mereka, memberikan dasar yang kuat dan dapat diskalakan untuk pengembangan dan penyebaran model yayasan generasi berikutnya.