Yapay zeka modellerinin her geçen gün daha fazla parametreye ulaşması, GPU’larda kullanılan yüksek hızlı belleklerin kapasitesini ve maliyetini teknoloji şirketlerinin gündemine taşıyor. Büyük dil modellerinin çalıştırılması sırasında model ağırlıklarının bellekte tutulması gerekiyor ve kullanılan model büyüdükçe ihtiyaç duyulan kapasite de artıyor. Bellek üreticisi Micron, yüksek kapasiteli yapay zeka modellerinde ortaya çıkan ihtiyaca karşı “Near-GPU NAND” adı verilen yeni bir yaklaşım üzerinde çalışıyor. Planlanan sistemde NAND Flash depolama, standart sunucu mimarilerinde olduğu gibi GPU’dan uzakta tutulmak yerine işlemciye çok daha yakın konumlandırılıyor. Hedef, GPU ile NAND arasındaki veri aktarımında ortaya çıkan gecikmeyi azaltırken giriş ve çıkış performansını artırmak. Micron’un üzerinde çalıştığı sistemde NAND Flash’ın HBM veya DRAM’in doğrudan yerine geçmesi planlanmıyor. NAND’ın yüksek hızlı GPU belleği ile standart depolama arasında yüksek kapasiteli ve daha düşük maliyetli ek bir bellek katmanı olarak kullanılması hedefleniyor.
Near-GPU NAND Nasıl Çalışacak?
Near-GPU NAND yaklaşımında NAND Flash’ın GPU’ya fiziksel ve mimari açıdan daha yakın konumlandırılması planlanıyor. Günümüzde kullanılan standart depolama çözümlerindeki bazı veri yollarının ve protokollerin oluşturduğu gecikmenin azaltılması hedefleniyor.
Sistemin HBM, GDDR7 veya LPDDR6 gibi GPU’ya yakın çalışan belleklerin yerini tamamen alması beklenmiyor. NAND Flash, söz konusu yüksek hızlı belleklerle klasik SSD depolama arasında farklı görev üstlenen ek katman olarak düşünülüyor.
NAND’ın gigabayt başına maliyetinin HBM ve DRAM’e göre daha düşük olması, yüksek kapasiteli yapay zeka sistemlerinde maliyet açısından yeni seçenek sağlayabilir. Modelin tamamının pahalı HBM içerisinde tutulması yerine daha sık ihtiyaç duyulan veriler yüksek hızlı bellekte, diğer model ağırlıkları ise daha yüksek kapasiteli NAND katmanında saklanabilir.
Söz konusu yöntem, HBM kapasitesine sığmayan büyük dil modellerinde kullanılabilir. Model ağırlıklarının bazı bölümlerinin NAND üzerinde tutulması sayesinde daha büyük yapay zeka modellerinin daha az GPU ile çalıştırılması hedefleniyor.
Sistemin verimli çalışabilmesi için yazılım tarafında da farklı bir bellek yönetimi gerekecek. Hangi verinin HBM’de, hangisinin NAND katmanında tutulacağının belirlenmesi ve ihtiyaç duyulan verilerin katmanlar arasında zamanında aktarılması performansı doğrudan etkileyecek.
NAND Flash İle HBM Arasındaki Hız Farkı En Büyük Engel
Near-GPU NAND teknolojisinin önünde aşılması gereken teknik sorunlar bulunuyor. NAND Flash, HBM ve DRAM ile karşılaştırıldığında bant genişliği ve erişim gecikmesi konusunda daha düşük performans gösteriyor. Yazma dayanıklılığı da üzerinde çalışılması gereken konular arasında yer alıyor.
NAND’ın GPU’ya yaklaştırılması tek başına HBM seviyesinde performans sunmayacak. Micron’un yaklaşımında hedef, NAND’ın yüksek kapasitesinden ve daha düşük maliyetinden yararlanırken erişim sürelerini yapay zeka iş yükleri için kabul edilebilir seviyeye getirmek.
Teknolojinin kullanılabilir hale gelmesi durumunda milyarlarca parametreye sahip büyük dil modellerinin çalıştırılmasında ihtiyaç duyulan pahalı HBM miktarı azaltılabilir. Daha yüksek kapasiteli NAND katmanının devreye alınmasıyla yapay zeka çıkarım altyapılarında farklı bellek türlerinin birlikte kullanıldığı yeni sistemlerin önü açılabilir.
Near-GPU NAND henüz üzerinde çalışılan bir teknoloji olarak öne çıkıyor. Performans, veri aktarımı, dayanıklılık ve yazılım yönetimi tarafındaki çalışmaların nasıl ilerleyeceği, sistemin yapay zeka altyapılarında ne ölçüde kullanılabileceğini belirleyecek.