Üniversite mühendislik fakültesi için GPU, depolama ve ağ altyapısı
Bir GPU sunucusu, ZFS tabanlı ortak depolama, 100 GbE omurga ve sınıf içindeki beş iş istasyonu. ANSYS CFD ve derin öğrenme derslerinin aynı altyapıyı paylaşması.
Bir mühendislik fakültesinin makine mühendisliği bölümü için kurgulanan bu altyapı, tek bir sunucudan ibaret değildi. Aynı sistemi hem akışkanlar dinamiği simülasyonları hem derin öğrenme dersleri kullanacaktı ve bu iki iş yükünün gereksinimleri birbirine benzemiyor.
Ne kuruldu
Hesaplama katmanı. AMD EPYC 9684X işlemcili ve RTX 5090 GPU'lu bir STUUX GPU sunucusu. 9684X'in büyük L3 önbelleği CFD çözücülerinde belirgin fark yaratıyor; ANSYS Fluent gibi çözücülerde performans çoğu zaman çekirdek sayısından çok bellek alt sistemine bağlı.
Depolama katmanı. TrueNAS R20 tabanlı, OpenZFS üzerinde çalışan ortak depolama. Simülasyon çıktıları ve eğitim veri setleri burada duruyor, iş istasyonları ve sunucu aynı veriye erişiyor.
Ağ katmanı. İki kademeli bir yapı kuruldu.
Sunucu odasında 100 GbE omurga: GPU sunucusu ve TrueNAS depolama birbirine 100 GbE ile bağlı. Bu bağlantının sebebi basit; bir çözücü çalışırken depolamadan gelen veri akışı, sunucunun hesaplama hızına yetişmek zorunda. 10 GbE ile bağlarsanız 100 bin dolarlık sunucu, ağdan veri beklemekle vakit geçirir.
Sınıf tarafında 10 GbE erişim katmanı: beş iş istasyonu 10 GbE ile bir erişim anahtarına, o anahtar da 100 GbE uplink ile omurgaya bağlı. Öğrencilerin her biri kendi iş istasyonunda çalışırken aynı ortak veri havuzuna erişiyor.
İş istasyonları. Sınıfta beş adet, pre/post-processing ve model geliştirme için.
Neden iki kademeli ağ
Herkesi 100 GbE ile bağlamak teknik olarak mümkün ama gereksiz pahalı. Bir iş istasyonunun tek başına 100 Gbit doyurması pratikte mümkün değil. Buna karşılık beş iş istasyonu aynı anda depolamaya yüklenirse, erişim anahtarının omurgaya 100 GbE ile bağlı olması sıkışmayı önlüyor.
Yani para, gerçekten bant genişliğine ihtiyaç duyulan yere harcanıyor: sunucu ile depolama arasına ve erişim katmanının uplink'ine.
Kullanım senaryoları
Altyapı iki farklı ders ve araştırma hattına hizmet ediyor:
Akışkanlar dinamiği ve ısı transferi simülasyonları. ANSYS CFD çözücüleri, rüzgâr enerjisi ve enerji depolama sistemleri üzerine yürütülen araştırma projeleri.
Derin öğrenme uygulamaları. GPU sunucusu üzerinde eğitim, iş istasyonlarında veri hazırlama ve sonuç değerlendirme.
Bu tip projelerde gördüğümüz en yaygın hata
Bütçenin tamamının hesaplama tarafına harcanması. Güçlü bir GPU sunucusu alınıp depolama ve ağ eski haliyle bırakıldığında, sistem kâğıt üzerindeki performansının çok altında çalışıyor. Simülasyon çıktıları gigabaytlarca yer kaplıyor ve bunları 1 GbE üzerinden taşımaya çalışan bir kullanıcı, sonuçlarını beklemekle geçirdiği süreyi hesaplamaya harcanan süreden ayıramıyor.
Altyapıyı kurgularken hesaplama, depolama ve ağı tek bir bütçe kalemi gibi ele almak daha sağlıklı sonuç veriyor.
Rehberlerden devam edin
Aynı performansı sizin için de kuralım
Kullandığınız uygulamaları ve iş akışınızı anlatın; sistemi ona göre boyutlandıralım.