NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Buku Putih Teknis
July 24, 2026
Makalah Teknis Adaptor Server NVIDIA Mellanox MCX623106AN-CDAT | Transportasi Latensi Rendah RDMA/RoCE & Optimalisasi Throughput Server
1. Latar Belakang Proyek & Analisis Persyaratan
Pusat data modern sedang mengalami pergeseran paradigma yang didorong oleh pertumbuhan pesat kecerdasan buatan, pembelajaran mesin skala besar, dan analitik waktu nyata. Beban kerja ini menuntut kinerja jaringan yang belum pernah terjadi sebelumnya — tidak hanya bandwidth mentah, tetapi latensi deterministik sub-5µs, pergerakan data yang efisien CPU, dan skalabilitas mulus ke ribuan node. Adaptor Ethernet tradisional, yang bergantung pada tumpukan TCP/IP berbasis perangkat lunak, telah menjadi hambatan kritis, mengonsumsi hingga 40% inti CPU pada kecepatan 200GbE dan memperkenalkan variasi latensi yang tidak dapat diprediksi yang menurunkan kinerja aplikasi. Bagi organisasi yang membangun kluster AI skala besar (500+ GPU) atau infrastruktur cloud hyperscale, inefisiensi ini secara langsung diterjemahkan menjadi waktu pelatihan yang diperpanjang, biaya infrastruktur yang lebih tinggi, dan waktu pemasaran yang lebih lambat.
Makalah ini menyajikan solusi teknis komprehensif yang berpusat pada adaptor server NVIDIA Mellanox MCX623106AN-CDAT. Dirancang untuk perusahaan yang ingin memaksimalkan investasi 200GbE mereka, kartu adaptor Ethernet MCX623106AN-CDAT memberikan RDMA over Converged Ethernet (RoCE) yang dipercepat perangkat keras, memungkinkan transportasi tanpa kehilangan, latensi ultra-rendah yang mengubah I/O jaringan dari hambatan penskalaan menjadi keunggulan kompetitif. Solusi ini secara khusus dirancang untuk memenuhi tiga tujuan inti: (1) mencapai latensi aplikasi ujung ke ujung sub-5µs untuk komunikasi kolektif AI, (2) mengurangi overhead pemrosesan jaringan CPU di bawah 5%, dan (3) menyediakan fondasi yang dapat diskalakan dan tahan masa depan untuk 200GbE dan seterusnya.
2. Desain Arsitektur Jaringan & Sistem Keseluruhan
Arsitektur yang direkomendasikan mengadopsi topologi leaf-spine berkinerja tinggi dengan 200GbE sebagai lapisan akses server dan uplink 400GbE/800GbE ke spine. Inti dari desain ini adalah kartu jaringan PCIe adaptor MCX623106AN-CDAT ConnectX, yang diterapkan di setiap node komputasi dan penyimpanan di seluruh fabric. Arsitektur dibangun di sekitar enam prinsip utama:
- Fabric Ethernet Tanpa Kehilangan: Memanfaatkan RoCE v2 dengan PFC (Priority Flow Control) dan ECN (Explicit Congestion Notification) di semua switch untuk menghilangkan kehilangan paket dan memastikan latensi deterministik untuk lalu lintas RDMA.
- GPUDirect RDMA: Memungkinkan komunikasi GPU-ke-GPU langsung di seluruh jaringan tanpa keterlibatan CPU, mengurangi latensi dan membebaskan sumber daya CPU untuk tugas komputasi.
- Offload Perangkat Keras di Mana Saja: Memindahkan protokol transportasi, keamanan (IPsec/MACsec), dan penyimpanan ke adaptor, membebaskan siklus CPU untuk logika aplikasi.
- Redundansi Aktif-Aktif: Memanfaatkan kedua port QSFP112 dalam mode agregasi tautan (LACP) untuk bandwidth agregat 400Gb/s dan failover otomatis dengan pemulihan sub-detik.
- Rekayasa Lalu Lintas Cerdas: Perutean adaptif dan pengiriman paket tidak berurutan untuk menghindari hotspot kemacetan dan memaksimalkan pemanfaatan fabric.
- Telemetri Komprehensif: Telemetri jaringan dalam pita (INT) dan pemantauan per-aliran untuk deteksi kemacetan proaktif dan perencanaan kapasitas.
Solusi ini sepenuhnya MCX623106AN-CDAT kompatibel dengan platform GPU NVIDIA (HGX, DGX) dan server CPU terkemuka dari Dell, HPE, Supermicro, dan Lenovo. Untuk penyimpanan, arsitektur mendukung NVMe-oF melalui RoCE dengan latensi sub-15µs, memungkinkan penyimpanan terdisagregasi bersama untuk kluster pelatihan skala besar.
3. Peran & Fitur Utama NVIDIA Mellanox MCX623106AN-CDAT
Sebagai komponen dasar dari solusi ini, NVIDIA Mellanox MCX623106AN-CDAT melayani empat peran penting dalam arsitektur:
| Fungsi | Detail Implementasi | Manfaat Bisnis |
|---|---|---|
| Mesin RDMA/RoCE | RoCE v2 berbasis perangkat keras dengan ECN/PFC, latensi sub-0,6µs, dukungan GPUDirect | Keterlibatan CPU mendekati nol; 8x lebih cepat all-reduce untuk pelatihan AI |
| 200GbE Dual-Port | Dua port QSFP112 independen, throughput agregat 400Gb/s | Pengikatan aktif-aktif untuk bandwidth; aktif-siaga untuk redundansi |
| Antarmuka PCIe 5.0 | PCIe 5.0 x16 (hingga 32 GT/s) dengan mesin DMA canggih | Menghilangkan hambatan antarmuka host untuk lalu lintas 200GbE |
| Offload Virtualisasi & Overlay | SR-IOV dengan hingga 512 VF per port; offload VXLAN/NVGRE/IPsec/MACsec | Multi-tenancy kepadatan tinggi dengan keamanan dan kinerja kecepatan garis |
Spesifikasi teknis utama yang diekstrak dari lembar data MCX623106AN-CDAT mencakup kemampuan offload komprehensif (checksum, LSO/LRO, pemotongan/penyisipan VLAN, RSS dengan hingga 128 antrean), algoritma kontrol kemacetan canggih, dan dukungan penuh untuk pustaka komunikasi kolektif NVIDIA (NCCL). Spesifikasi MCX623106AN-CDAT juga menyoroti dukungan untuk kompatibilitas 100GbE dan 50GbE, menawarkan fleksibilitas penerapan untuk lingkungan kecepatan campuran.
4. Rekomendasi Penerapan & Penskalaan
Untuk kluster AI baru, kami merekomendasikan topologi leaf-spine dua tingkat dengan akses 200GbE dan uplink spine 800GbE. Setiap server menampung satu kartu adaptor Ethernet MCX623106AN-CDAT dengan kedua port QSFP112 terhubung ke switch leaf terpisah untuk redundansi. Fabric RoCE memerlukan konfigurasi QoS yang konsisten di semua switch — khususnya, PFC pada prioritas 3 (untuk lalu lintas kolektif RDMA) dan prioritas 4 (untuk penyimpanan), dengan penandaan ECN pada kelas lalu lintas yang sama. Kami merekomendasikan untuk mendedikasikan VLAN terpisah untuk lalu lintas RDMA, manajemen, penyimpanan, dan penyewa untuk menyederhanakan pemantauan dan pemecahan masalah.
Untuk lingkungan yang sudah ada dengan infrastruktur 100GbE yang ada, solusi kartu adaptor Ethernet MCX623106AN-CDAT menawarkan jalur migrasi yang mulus. Karena adaptor kompatibel dengan optik QSFP56 100GbE, kabel yang ada dapat digunakan kembali selama peningkatan bertahap ke 200GbE. Adaptor juga mendukung switching Ethernet standar tanpa pengaktifan RoCE wajib, memungkinkan tim untuk menerapkan perangkat keras terlebih dahulu dan mengaktifkan kemampuan RDMA secara bertahap seiring matangnya fabric dan beban kerja membenarkan transisi.
Penskalaan solusi di luar 500 node memerlukan pertimbangan tambahan. Kami merekomendasikan penerapan strategi manajemen kemacetan RoCE khusus menggunakan switch NVIDIA Spectrum-4 dengan telemetri bawaan dan penyesuaian ambang batas ECN dinamis. Untuk kluster yang melebihi 1.000 node, pertimbangkan untuk menerapkan pengontrol manajemen fabric terpusat (misalnya, NVIDIA NetQ) untuk mempertahankan visibilitas ujung ke ujung dan konsistensi konfigurasi otomatis. MCX623106AN-CDAT untuk dijual melalui mitra saluran global NVIDIA mencakup garansi komprehensif dan dukungan pembaruan firmware, memastikan keandalan jangka panjang pada skala.
5. Operasi, Pemantauan, Pemecahan Masalah & Optimalisasi
Operasi yang efektif dari fabric RoCE memerlukan strategi pemantauan dan pemecahan masalah berlapis:
- Telemetri Tingkat Adaptor: Spesifikasi MCX623106AN-CDAT mencakup penghitung per-port untuk frame PFC, paket yang ditandai ECN, frame yang hilang, kesalahan tautan, dan epoch kemacetan. Gunakan
mlx5cmd,ethtool, atau alat firmware NVIDIA untuk mengekspor metrik ini ke dasbor Prometheus/Grafana dengan peringatan yang sesuai. - Telemetri Jaringan Dalam Pita (INT): Manfaatkan dukungan INT adaptor untuk melacak latensi per-aliran dan kedalaman antrean di seluruh fabric, memungkinkan identifikasi sumber kemacetan mikro yang tepat.
- Pemantauan Tingkat Switch: Pantau hunian buffer, jumlah frame jeda, kedalaman antrean, dan tingkat penandaan ECN pada switch spine dan leaf. Peningkatan tiba-tiba dalam frame jeda menunjukkan kemacetan mikro yang mungkin memerlukan penyetelan ambang batas ECN.
- Metrik Tingkat Aplikasi: Untuk aplikasi RDMA, lacak latensi penyelesaian WR (Work Request), peristiwa luapan CQ (Completion Queue), dan jumlah kesalahan QP (Queue Pair) menggunakan pustaka NVIDIA libibverbs dan rdma-core.
Skenario pemecahan masalah umum dan tindakan yang direkomendasikan:
- Penurunan kinerja RoCE: Verifikasi PFC diaktifkan pada semua port switch dan bahwa penandaan DSCP sesuai dengan konfigurasi switch. Gunakan lembar data MCX623106AN-CDAT untuk memvalidasi pengaturan alokasi buffer terhadap nilai yang direkomendasikan untuk profil beban kerja Anda.
- Flapping tautan atau kesalahan CRC: Periksa kualitas kabel QSFP112 (pastikan sesuai dengan spesifikasi AOC atau DAC 200G) dan verifikasi bahwa firmware adaptor diperbarui ke rilis terbaru.
- Masalah kinerja GPU Direct: Konfirmasikan bahwa GPUDirect diinisialisasi dengan benar dan bahwa topologi PCIe mendukung DMA peer-to-peer tanpa switching perantara.
- Kebuntuan PFC atau badai jeda: Periksa prioritas yang salah dikonfigurasi, dan pastikan bahwa PFC hanya diaktifkan pada kelas lalu lintas RoCE (bukan pada lalu lintas manajemen atau penyimpanan).
Untuk optimalisasi, kami merekomendasikan parameter penyetelan berikut berdasarkan validasi lab ekstensif:
- Koalesensi interupsi (moderasi): Atur ke 2–4 µs untuk beban kerja pelatihan AI untuk meminimalkan latensi sambil mempertahankan efisiensi CPU.
- RDMA MTU: Tingkatkan menjadi 4096 byte untuk komunikasi all-reduce untuk mengurangi overhead protokol dan meningkatkan throughput.
- RSS (Receive Side Scaling): Konfigurasi di beberapa inti CPU untuk lalu lintas non-RDMA untuk mendistribusikan pemrosesan dan menghindari saturasi inti tunggal.
- Ambang batas ECN: Atur min-threshold pada 40% buffer dan max-threshold pada 75% untuk lalu lintas prioritas 3, sesuaikan berdasarkan pola kemacetan yang diamati dan karakteristik beban kerja.
6. Ringkasan & Penilaian Nilai
Solusi NVIDIA Mellanox MCX623106AN-CDAT memberikan nilai transformatif untuk pusat data skala AI modern. Dengan mengganti TCP/IP berbasis perangkat lunak dengan RDMA/RoCE dan GPUDirect yang dipercepat perangkat keras, organisasi dapat mencapai pengurangan latensi tingkat aplikasi 8–10x, memotong overhead jaringan CPU lebih dari 85%, dan meningkatkan pemanfaatan GPU dari di bawah 70% menjadi lebih dari 95%. kartu adaptor Ethernet MCX623106AN-CDAT menyediakan jalur hemat biaya untuk adopsi 200GbE dengan perlindungan investasi melalui kompatibilitas mundur ke 100GbE dan kemampuan offload yang siap masa depan untuk beban kerja yang muncul.
Saat mengevaluasi total biaya kepemilikan, harga MCX623106AN-CDAT diimbangi oleh penghematan operasional yang signifikan: pengurangan waktu pelatihan (mempercepat waktu pemasaran), jumlah server yang lebih rendah (karena pemanfaatan GPU yang lebih tinggi), pengurangan biaya pendinginan (berkat <20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully MCX623106AN-CDAT kompatibel dengan tumpukan perangkat lunak AI dan HPC utama, termasuk NVIDIA NCCL, PyTorch, TensorFlow, dan pustaka MPI, memastikan penerapan yang luas di seluruh penerapan perusahaan, cloud, dan penelitian.
Untuk skrip penerapan terperinci, templat konfigurasi, dan laporan tolok ukur kinerja, silakan merujuk ke lembar data MCX623106AN-CDAT resmi dan portal dokumentasi jaringan komprehensif NVIDIA. Makalah ini berfungsi sebagai fondasi — arsitektur divalidasi, komponen siap produksi, dan manfaatnya terukur. kartu jaringan PCIe adaptor MCX623106AN-CDAT ConnectX bukan hanya adaptor; ini adalah penggerak strategis untuk pusat data siap AI, latensi ultra-rendah di masa depan.

