NVIDIA Mellanox MCX631432AN-ADAB Beraksi: Transport Latensi Rendah RDMA/RoCE dan Optimalisasi Throughput Server

July 28, 2026

berita perusahaan terbaru tentang NVIDIA Mellanox MCX631432AN-ADAB Beraksi: Transport Latensi Rendah RDMA/RoCE dan Optimalisasi Throughput Server

NVIDIA Mellanox MCX631432AN-ADAB Beraksi: Transportasi Latensi Rendah RDMA/RoCE dan Optimalisasi Throughput Server

Latar Belakang & Tantangan: Hambatan Jaringan dalam Klaster Pelatihan AI

Sebuah perusahaan fintech terkemuka baru-baru ini menerapkan klaster AI berbasis GPU 64 node yang dirancang untuk pelatihan strategi perdagangan frekuensi tinggi, dengan setiap server dilengkapi penyimpanan NVMe berkinerja tinggi. Namun, setelah go-live, throughput pelatihan aktual turun secara signifikan di bawah ekspektasi. Analisis pasca-penerapan mengungkapkan bahwa jaringan komunikasi antar-node berbasis 10GbE TCP/IP telah menjadi hambatan utama. Operasi komunikasi kolektif All-Reduce menunjukkan latensi setinggi 4–5 milidetik, sementara overhead CPU untuk pemrosesan protokol jaringan melebihi 40% — sangat membatasi pipeline pra-pemrosesan data GPU. Tim sangat membutuhkan solusi jaringan yang dapat secara dramatis mengurangi latensi komunikasi dan memulihkan kapasitas komputasi CPU.

Solusi & Penerapan: Membangun Jaringan Tanpa Kehilangan RoCE dengan MCX631432AN-ADAB

Setelah evaluasi teknis yang komprehensif, tim memilihNVIDIA Mellanox MCX631432AN-ADABsebagai fondasi peningkatan jaringan mereka. Setiap server dilengkapi dengan adaptorMCX631432AN-ADAB ConnectX-6 Lx dual-port 25GbE SFP28, dengan kedua port SFP28 terhubung ke switch NVIDIA Spectrum-3 redundan untuk membangun arsitektur yang sangat tersedia.

Penerapan dilaksanakan dalam tiga fase terpisah:

  • Fase 1 — Uji Coba (8 node):Tim menginstalkartu adaptor Ethernet MCX631432AN-ADABpada sebagian server GPU, mengkonfigurasi RoCEv2 dengan Priority Flow Control (PFC) dan Explicit Congestion Notification (ECN) untuk menciptakan jaringan Ethernet tanpa kehilangan. NCCL (NVIDIA Collective Communications Library) dikompilasi ulang dengan dukungan RDMA.
  • Fase 2 — Penyetelan & Validasi:Menggunakan data telemetri yang dirinci dalamlembar data MCX631432AN-ADAB, tim menyetel parameter DCB dan ambang batas buffer untuk menghilangkan badai jeda PFC sambil mempertahankan kehilangan paket mendekati nol. Spesifikasi MCX631432AN-ADABmemandu optimalisasi moderasi interupsi dan kedalaman antrean untuk profil beban kerja tertentu.
  • Fase 3 — Peluncuran Produksi Penuh (64 node):Setelah validasi berhasil, node yang tersisa dimigrasikan ke adaptor baru. DriverMCX631432AN-ADAB yang kompatibelterintegrasi dengan mulus dengan lingkungan berbasis Ubuntu yang ada dan tumpukan Mellanox OFED.

Tim mencatat bahwasolusi kartu adaptor Ethernet MCX631432AN-ADABmenyediakan jalur migrasi yang mudah, karena adaptor sepenuhnya kompatibel dengan infrastruktur kabel dan switch SFP28 yang ada, menghilangkan kebutuhan akan peningkatan tambahan yang mahal.

Hasil & Manfaat: Transformasi Terukur dalam Latensi dan Throughput

Peningkatan kinerja yang dicapai melalui penerapanNVIDIA Mellanox MCX631432AN-ADABsegera dan substansial. Tabel berikut merangkum metrik utama sebelum dan sesudah peningkatan:

Metrik Sebelum Peningkatan (10GbE TCP/IP) Setelah Peningkatan (MCX631432AN-ADAB dengan RoCE) Peningkatan
Latensi All-Reduce (rata-rata) 4,7 ms 0,32 ms Pengurangan 14,7×
Utilisasi CPU Jaringan (per node) 42% 9% 33 pp dibebaskan
Utilisasi GPU (fase pemuatan data) 61% 89% +28%
Throughput Pelatihan Klaster 1,8x baseline 4,3x baseline Peningkatan 2,4×

Di luar peningkatan kuantitatif ini, tim mengamati peningkatan operasional yang secara langsung memengaruhi produktivitas pengembang. Proses pelatihan model yang sebelumnya membutuhkan 36 jam selesai hanya dalam 15 jam, memungkinkan siklus iterasi yang lebih sering. Offload NVMe-oF berbasis perangkat keras juga mengurangi latensi akses penyimpanan sebesar 35%, semakin mempercepat operasi checkpoint yang intensif data. Bagi organisasi yang mengevaluasi kasus bisnis,harga MCX631432AN-ADABterbukti sangat kompetitif jika diukur terhadap peningkatan throughput 2,4× dan kemampuan untuk menunda akuisisi server GPU tambahan. Tim juga mencatat bahwa bundelMCX631432AN-ADAB untuk dijualdengan switch NVIDIA Spectrum menawarkan jalur paling hemat biaya untuk penskalaan di masa depan.

Ringkasan & Prospek: Fondasi untuk Inovasi Beban Kerja Masa Depan

Penerapan produksi ini menunjukkan bahwaNVIDIA Mellanox MCX631432AN-ADABjauh lebih dari sekadar penyegaran jaringan rutin — ini adalah elemen infrastruktur transformatif yang membuka potensi penuh komputasi yang dipercepat GPU modern. Kombinasi bandwidth agregat 50 Gb/s, latensi komunikasi kolektif di bawah 0,4 ms, dan kemampuan offload CPU yang dramatis memposisikan adaptor ini sebagai pilihan ideal bagi organisasi yang menjalankan beban kerja AI terdistribusi, HPC, dan analitik real-time.

Ke depan, tim fintech sedang menjajaki integrasi dengan NVIDIA DOCA untuk lebih mempercepat pemrograman jalur data dan untuk mengimplementasikan penyediaan tanpa sentuhan untuk ekspansi klaster di masa depan. Mereka juga mengevaluasi kemampuan telemetri adaptor — yang dirinci secara ekstensif dalamlembar data MCX631432AN-ADAB — untuk membangun model manajemen kemacetan prediktif. Seiringsolusi kartu adaptor Ethernet MCX631432AN-ADABterus membuktikan nilainya, perusahaan berencana untuk menstandarkan platform ini untuk semua investasi infrastruktur di masa depan, yakin bahwa platform ini menyediakan fondasi yang kuat dan dapat diskalakan untuk generasi berikutnya dari aplikasi keuangan yang digerakkan oleh AI.