NVIDIA Mellanox MCX653106A-HDAT Beraksi: Transport Latensi Rendah RDMA/RoCE dan Optimalisasi Throughput Server

July 30, 2026

berita perusahaan terbaru tentang NVIDIA Mellanox MCX653106A-HDAT Beraksi: Transport Latensi Rendah RDMA/RoCE dan Optimalisasi Throughput Server
NVIDIA Mellanox MCX653106A-HDAT Beraksi: Transportasi Latensi Rendah RDMA/RoCE dan Optimalisasi Throughput Server
Latar Belakang & Tantangan: Hambatan Jaringan Penyedia Cloud Skala Besar

Penyedia cloud skala besar utama yang mengoperasikan kluster 256 node untuk pelatihan AI terdistribusi dan analitik real-time mulai mengalami degradasi kinerja jaringan yang parah seiring dengan peningkatan infrastruktur mereka. Jaringan berbasis TCP/IP 25GbE yang ada menunjukkan latensi All-Reduce melebihi 6 milidetik di 128 node, sementara pemanfaatan CPU untuk pemrosesan jaringan mengonsumsi lebih dari 40% kapasitas komputasi setiap server. Hambatan ini membatasi pemanfaatan GPU hanya 55%, secara dramatis memperpanjang siklus pelatihan dan mengurangi kapasitas penghasil pendapatan. Tim membutuhkan solusi yang dapat memberikan latensi skala mikrodetik dan bandwidth besar sambil menyediakan kemampuan pemrograman yang diperlukan untuk optimalisasi lalu lintas spesifik beban kerja.

Solusi & Penerapan: Mentransformasi Jaringan dengan MCX653106A-HDAT

Setelah evaluasi teknis yang ekstensif, penyedia memilih NVIDIA Mellanox MCX653106A-HDAT sebagai landasan transformasi jaringan mereka. Setiap node server dilengkapi dengan kartu jaringan PCIe adapter MCX653106A-HDAT ConnectX, dikonfigurasi dengan konektivitas 100GbE dual-port untuk memberikan bandwidth agregat 200 Gb/s per node.

  • Fase 1 — Uji Coba (8 node): Tim menginstal kartu adapter Ethernet MCX653106A-HDAT pada sebagian server GPU, mengkonfigurasi RoCEv2 dengan PFC dan ECN untuk membangun jaringan Ethernet tanpa kehilangan data. Adapter dipasangkan dengan switch NVIDIA Spectrum-4 untuk manajemen kongesti ujung ke ujung.
  • Fase 2 — Validasi & Penyetelan: Menggunakan data telemetri yang didokumentasikan dalam datasheet MCX653106A-HDAT, tim memvalidasi konfigurasi, menyetel parameter DCB, dan mengoptimalkan pengaturan komunikasi kolektif NCCL. Fitur pemrograman lanjutan adapter memungkinkan pengarahan lalu lintas kustom untuk pola all-reduce spesifik dari beban kerja.
  • Fase 3 — Peluncuran Produksi Penuh (256 node): Setelah validasi berhasil, seluruh kluster dimigrasikan ke adapter baru. Sifat MCX653106A-HDAT yang kompatibel dari solusi memastikan integrasi yang mulus dengan server dan distribusi Linux yang ada.
  • Fase 4 — Optimalisasi Berkelanjutan: Tim memanfaatkan telemetri inline adapter dan jalur data yang dapat diprogram untuk mengimplementasikan kebijakan perutean yang sadar beban kerja, lebih lanjut mengoptimalkan kinerja untuk pekerjaan pelatihan AI.

Tim mencatat bahwa solusi kartu adapter Ethernet MCX653106A-HDAT menyediakan jalur migrasi yang mudah, karena port QSFP56 mendukung optik 100GbE dan 25GbE, memungkinkan transisi yang mulus tanpa mengganggu konektivitas yang ada.

Hasil & Manfaat: Transformasi Terukur dalam Kinerja dan Efisiensi
Metrik Sebelum Peningkatan (25GbE TCP/IP) Setelah Peningkatan (MCX653106A-HDAT dengan RoCE) Peningkatan
Latensi All-Reduce (256 node) 6,8 md 0,22 md Pengurangan 30,9*
Pemanfaatan CPU Jaringan (per node) 43% 5% 38 pp dipulihkan
Pemanfaatan GPU (fase pelatihan) 55% 93% Peningkatan +38%
Throughput Pelatihan Kluster 2,1x baseline 6,4x baseline Peningkatan 3,0*

Selain peningkatan kuantitatif ini, penyedia mengamati manfaat operasional yang signifikan. Pelatihan yang sebelumnya membutuhkan 14 hari selesai hanya dalam 4,5 hari, secara dramatis mempercepat waktu ke pasar untuk layanan AI baru. Jalur data yang dapat diprogram adapter memungkinkan pembentukan lalu lintas kustom untuk aliran prioritas, memastikan bahwa lalu lintas komunikasi kolektif yang kritis tidak pernah mengalami persaingan. Bagi organisasi yang mengevaluasi pengembalian investasi, harga MCX653106A-HDAT terbukti sepenuhnya dibenarkan oleh peningkatan throughput 3* dan kemampuan untuk menunda akuisisi server tambahan selama lebih dari 18 bulan. Tim juga mencatat bahwa bundel MCX653106A-HDAT untuk dijual dengan switch NVIDIA Spectrum-4 menawarkan ekonomi yang paling menguntungkan untuk penerapan skala besar.

Penyedia juga memanfaatkan kemampuan telemetri komprehensif yang dirinci dalam spesifikasi MCX653106A-HDAT untuk membangun model kinerja prediktif dan strategi mitigasi kongesti otomatis, lebih meningkatkan efisiensi operasional.

Ringkasan & Prospek: Fondasi untuk Infrastruktur AI Skala Besar

Penerapan skala produksi ini menunjukkan bahwa NVIDIA Mellanox MCX653106A-HDAT adalah komponen transformatif untuk infrastruktur AI dan cloud modern. Kombinasi bandwidth agregat 200 Gb/s, latensi komunikasi kolektif di bawah 0,3 milidetik, dan offload perangkat keras yang komprehensif memungkinkan penskalaan yang hampir linier untuk beban kerja yang dipercepat GPU. Sebagai solusi kartu adapter Ethernet MCX653106A-HDAT ujung ke ujung, ini menghilangkan hambatan jaringan yang secara historis membatasi efisiensi pelatihan terdistribusi dan pengiriman layanan cloud.

Ke depan, penyedia cloud sedang menjajaki integrasi yang diperluas dengan NVIDIA DOCA untuk mengimplementasikan kemampuan pemrograman jalur data tambahan untuk optimalisasi spesifik beban kerja di berbagai lingkungan multi-penyewa. Mereka juga memanfaatkan telemetri inline adapter — yang didokumentasikan secara ekstensif dalam datasheet MCX653106A-HDAT — untuk mengembangkan sistem manajemen kinerja otomatis generasi berikutnya. NVIDIA Mellanox MCX653106A-HDAT telah menjadi fondasi peta jalan infrastruktur AI mereka, menyediakan platform yang kuat dan dapat diskalakan untuk pelatihan model dasar generasi berikutnya dan layanan analitik real-time.