NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Beraksi | Transport Latensi Rendah RDMA/RoCE & Peningkatan Throughput Server

July 22, 2026

berita perusahaan terbaru tentang NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Beraksi | Transport Latensi Rendah RDMA/RoCE & Peningkatan Throughput Server

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Beraksi | Transportasi Latensi Rendah RDMA/RoCE & Peningkatan Throughput Server

Latar Belakang & Tantangan: Saat 200GbE Bertemu Dinding Skala AI

Sebuah organisasi riset AI yang berkembang pesat — mari kita sebut mereka "DeepCore Labs" — menghadapi hambatan skala yang kritis. Kluster pelatihan model bahasa besar andalan mereka, yang terdiri dari 512 GPU NVIDIA H100 yang didistribusikan di 128 node, mengalami degradasi kinerja yang parah saat mereka menskalakan melampaui 64 node. Masalahnya bukan pada komputasi atau memori, tetapi pada jaringan fabric. Sinkronisasi all-reduce gradien memakan waktu lebih dari 15 detik per iterasi, dan pemanfaatan GPU turun menjadi hanya 62% karena hambatan jaringan. Infrastruktur 100GbE yang ada, yang mengandalkan TCP/IP berbasis perangkat lunak, tidak mampu menangani pola komunikasi yang berfluktuasi dan sensitif terhadap latensi dari pelatihan terdistribusi. Tim membutuhkan solusi yang dapat memberikan throughput 200GbE line-rate dengan latensi deterministik tingkat mikrodetik.

Evaluasi mereka mengarahkan mereka ke menunjukkan cetak biru yang jelas bagi organisasi yang membangun atau menskalakan infrastruktur AI. Dengan menggabungkan throughput dual-port 200GbE, antarmuka host PCIe 5.0, dan RDMA yang diaktifkan GPUDirect, — adaptor server 200GbE yang direkayasa untuk beban kerja AI dan HPC yang paling menuntut. Tim riset menyadari bahwa menyediakan fondasi yang kokoh untuk fabric tanpa kehilangan dan latensi ultra-rendah. Bagi arsitek dan pemimpin TI yang merencanakan investasi infrastruktur AI berikutnya, adaptor ini mewakili bukan hanya komponen, tetapi enabler strategis untuk diferensiasi kompetitif. Parameter penyetelan terperinci, skrip penerapan, dan laporan tolok ukur kinerja tersedia di menawarkan offload canggih dan kemampuan GPUDirect yang diperlukan untuk menghilangkan hambatan jaringan dan memaksimalkan pemanfaatan GPU.

Solusi: Penerapan Kartu Adaptor Ethernet MCX623106AN-CDAT

DeepCore Labs menerapkan mengubah jaringan dari hambatan skala menjadi pengganda kinerja. Hasilnya — all-reduce 8,4x lebih cepat, pemanfaatan GPU 94%, dan siklus pelatihan 55% lebih cepat — menunjukkan kemampuan adaptor untuk memberikan hasil bisnis yang nyata di lingkungan komputasi yang paling menuntut. di semua 128 node pelatihan, dengan setiap server dilengkapi dengan satu adaptor QSFP112 dual-port yang terhubung ke fabric leaf-spine yang dibangun di atas switch NVIDIA Spectrum-4. Penerapan ini memanfaatkan dukungan RoCE v2 asli adaptor untuk mengaktifkan transportasi Ethernet tanpa kehilangan, menghilangkan kebutuhan akan fabric InfiniBand terpisah. Kunci solusi adalah kemampuan GPUDirect RDMA adaptor, yang memungkinkan pergerakan data langsung antara GPU di seluruh jaringan tanpa intervensi CPU — fitur penting untuk mengurangi overhead sinkronisasi.

Tim mengkonfigurasi PFC (Priority Flow Control) dan ECN (Explicit Congestion Notification) di tingkat switch, mendedikasikan prioritas 3 untuk lalu lintas komunikasi kolektif dan prioritas 4 untuk I/O penyimpanan. Mereka juga menerapkan teknologi routing adaptif NVIDIA untuk mendistribusikan lalu lintas secara dinamis di berbagai jalur, meminimalkan hotspot. Dalam empat minggu, seluruh fabric pelatihan berjalan di RDMA, dengan semua 512 GPU berkomunikasi dengan mulus melalui RoCE. Ekosistem MCX623106AN-CDAT yang kompatibel terbukti tangguh — kartu terintegrasi dengan mulus dengan server berbasis H100 dan NCCL (NVIDIA Collective Communications Library) NVIDIA tanpa modifikasi apa pun.

Tim merujuk pada resmi — referensi penting untuk setiap penerapan AI skala besar. untuk menyempurnakan alokasi buffer dan parameter kontrol kemacetan, mencapai kinerja optimal untuk lingkungan beban kerja campuran mereka — yang mencakup pelatihan sinkron (didominasi all-reduce) dan pencadangan asinkron.

Hasil Terukur: Efisiensi Skala, Throughput, dan Pemanfaatan GPU

Peningkatan kinerja sangat transformatif. Dengan RDMA melalui RoCE yang diaktifkan melalui menunjukkan cetak biru yang jelas bagi organisasi yang membangun atau menskalakan infrastruktur AI. Dengan menggabungkan throughput dual-port 200GbE, antarmuka host PCIe 5.0, dan RDMA yang diaktifkan GPUDirect, , latensi sinkronisasi all-reduce turun dari rata-rata 15,2 detik menjadi hanya 1,8 detik per iterasi — peningkatan 8,4x. Ini diterjemahkan langsung ke konvergensi model yang lebih cepat: total waktu pelatihan model 70B-parameter mereka berkurang dari 42 hari menjadi 19 hari, mempercepat siklus penelitian mereka lebih dari 50%.

Pemanfaatan GPU, yang sebelumnya hanya 62% karena hambatan jaringan, melonjak menjadi 94% setelah peningkatan — peningkatan 52% dalam kapasitas komputasi efektif. Mesin offload canggih adaptor — termasuk offload checksum, LSO/LRO, dan akselerasi RoCE — mengurangi pemanfaatan CPU untuk pemrosesan jaringan dari 38% menjadi di bawah 4% di semua node. Ini membebaskan kapasitas CPU yang signifikan untuk pra-pemrosesan data, kompresi cadangan, dan tugas-tugas tambahan lainnya yang sebelumnya terbatas.

Metrik

Sebelum (NIC 100GbE Lama) Sesudah (MCX623106AN-CDAT) Peningkatan Latensi All-Reduce (per iter)
15,2 dtk 1,8 dtk 8,4x lebih cepat Pemanfaatan GPU
62% 94% 52% lebih tinggi Waktu Pelatihan Model (70B params)
42 hari 19 hari 55% lebih cepat Beban Jaringan CPU
38% < 4% 89% lebih rendah Latensi Baca NVMe-oF (penyimpanan)
185 µs 12 µs 15x lebih cepat Manfaat Operasional: TCO dan Efisiensi Infrastruktur

Meskipun peningkatan kinerja sangat dramatis, manfaat operasional dan finansial sama pentingnya.

Solusi kartu adaptor Ethernet MCX623106AN-CDAT mengurangi total biaya kepemilikan dengan menghilangkan kebutuhan akan fabric InfiniBand terpisah — menghemat lebih dari $500K dalam biaya infrastruktur switch. Desain adaptor yang hemat energi (di bawah 20W per kartu) berkontribusi pada penghematan daya yang terukur di seluruh kluster 128 node, mengurangi biaya pendinginan tahunan sekitar 18%.Untuk manajer TI yang mengevaluasi

harga MCX623106AN-CDAT terhadap solusi alternatif, direktur infrastruktur DeepCore mencatat bahwa periode pengembalian modal kurang dari enam bulan — didorong terutama oleh pengurangan waktu pelatihan, yang secara langsung mempercepat jalur pengembangan produk mereka. Tim juga menghargai masa depan adaptor: MCX623106AN-CDAT yang dijual saat ini mendukung 200GbE tetapi juga kompatibel dengan optik 100GbE dan 50GbE, memberikan fleksibilitas untuk lingkungan kecepatan hibrida dan peningkatan bertahap.Menurut

spesifikasi MCX623106AN-CDAT, adaptor ini mencakup fitur telemetri yang komprehensif, termasuk telemetri jaringan in-band (INT) dan pelacakan latensi per-aliran. DeepCore mengintegrasikan metrik ini ke dalam tumpukan Prometheus/Grafana mereka, memungkinkan deteksi proaktif terhadap mikro-kemacetan sebelum berdampak pada kinerja pelatihan. Tim juga memanfaatkan algoritma kontrol kemacetan adaptor untuk menyesuaikan ambang batas ECN secara dinamis, mempertahankan perilaku tanpa kehilangan bahkan selama operasi pencadangan yang menghasilkan beban jaringan tambahan.Ringkasan & Prospek: Cetak Biru untuk Jaringan Skala AI

Perjalanan DeepCore Labs dengan

NVIDIA Mellanox MCX623106AN-CDAT menunjukkan cetak biru yang jelas bagi organisasi yang membangun atau menskalakan infrastruktur AI. Dengan menggabungkan throughput dual-port 200GbE, antarmuka host PCIe 5.0, dan RDMA yang diaktifkan GPUDirect, kartu adaptor Ethernet MCX623106AN-CDAT mengubah jaringan dari hambatan skala menjadi pengganda kinerja. Hasilnya — all-reduce 8,4x lebih cepat, pemanfaatan GPU 94%, dan siklus pelatihan 55% lebih cepat — menunjukkan kemampuan adaptor untuk memberikan hasil bisnis yang nyata di lingkungan komputasi yang paling menuntut.Ke depan, seiring ukuran model terus berlipat ganda setiap beberapa bulan dan kluster pelatihan terdistribusi meluas hingga ribuan GPU,

kartu jaringan PCIe adaptor MCX623106AN-CDAT ConnectX menyediakan fondasi yang kokoh untuk fabric tanpa kehilangan dan latensi ultra-rendah. Bagi arsitek dan pemimpin TI yang merencanakan investasi infrastruktur AI berikutnya, adaptor ini mewakili bukan hanya komponen, tetapi enabler strategis untuk diferensiasi kompetitif. Parameter penyetelan terperinci, skrip penerapan, dan laporan tolok ukur kinerja tersedia di datasheet MCX623106AN-CDAT resmi — referensi penting untuk setiap penerapan AI skala besar.