NVIDIA AI Fabrikalari Icın Yeni Ag Protokolu MRC’yi Tanitti: GPU Kumedelerindeki Performans Sorunu Cozuluyor

NVIDIA, AI fabrikalari (buyuk GPU kumedeleri) icin tasarlanmiz Multipath Reliable Connection (MRC) protokolunu tanitti. OpenAI ve Microsoft’un aktif olarak kullandigi bu protokol, buyuk veri transferlerinin agdar bogazini gidermek icin gelistirildi.

Problem Nedir?

Geleneksel GPU kumelerinde buyuk veri transferleri (“elephant flows”) tek bir ag yolunu dogrurarak “tail latency” yaratiyor. Bu durum, egitim verimliligini olumsuz etkiliyor. MRC bu sorunu agi bir grid gibi davranarak packet spraying ile cozmeyi amacliyor.

MRC Nasil Calisiyor?

Protokol bircok yenilik getiriyor:

  1. Packet spraying: Paketler mevcut tum ag yollarina dagitiliyor
  2. Adaptive routing: Spectrum-4 switch’leri ve BlueField-3 SuperNIC’ler trafigi en az sikismis rota uzerinden yonlendiriyor
  3. Packet trimming: Buffer doldugunda switch payload’i kipirarak basligi iletiyor, bu da timeout-based retransmission yerine aninda yeniden iletim sagliyor
  4. Connection pooling: Birden fazla NIC tek connection context paylasiyor

Kim Kullaniyor?

Microsoft’un “Fairwater”, Oracle Cloud Infrastructure’nin “Abilene” ve OpenAI’nin frontier kumeleri MRC kullanuyor. Protokol Open Compute Project’e (OCP) acik standart olarak sunuldu, bu da endustri standardi olabilecegi anlamina geliyor.

Neden Onemli?

Yapay zeka modelleri buyudukce, binlerce GPU’nun bir arada calismasi gerekiyor. Bu kume ortamlarinda ag altyapisi kritik bir bottleneck haline geliyor. MRC gibi protokoller, yapay zeka mühendislerinin olusturdugu sistemlerin alt yapisini dogrudan etkiliyor - yani Türk yazilim gelistiricilerin üzerine insa ettigi sistemlerin performansini.

Kaynaklar