Kurumsal AI iş istasyonu: 96 GB VRAM üzerinde özel LLM ortamı
RTX PRO 6000 Blackwell tabanlı bir iş istasyonuna Ubuntu 24.04, CUDA yığını ve dört büyük dil modeli kuruldu. Kurumun verisi dışarı çıkmadan çalışan bir çıkarım ortamı.
Kurumların büyük bir kısmı yapay zekâyı kullanmak istiyor ama verisini bulut sağlayıcısına göndermek istemiyor. Bu projede tek bir iş istasyonuna, kurum içinde kalan ve dışarıya hiçbir veri göndermeyen bir dil modeli ortamı kurduk.
Donanım
| Bileşen | Seçim |
|---|---|
| Anakart | ASUS ProArt Z890-CREATOR WIFI |
| İşlemci | Intel Core Ultra 9 285K |
| Bellek | 256 GB DDR5 (4 × 64 GB) |
| Depolama | Samsung 9100 PRO 4 TB NVMe |
| GPU | NVIDIA RTX PRO 6000 Blackwell, 96 GB VRAM |
Buradaki kritik bileşen tek başına GPU. 96 GB VRAM, 100 milyar parametre sınıfındaki modelleri tek kartta çalıştırabilecek tek iş istasyonu kartı seviyesi. Sistem belleğinin 256 GB olması ise model yükleme sırasında ve büyük veri setleriyle çalışırken nefes payı bırakıyor.
Yazılım yığını
Ubuntu 24.04 LTS üzerine kurduk. Kurulan katmanlar:
| Katman | Sürüm / Detay |
|---|---|
| NVIDIA sürücüsü | 580.159.03 |
| CUDA Toolkit | 12.8 |
| cuDNN | 9 |
| NCCL | kurulu |
| Docker + NVIDIA Container Toolkit | kurulu |
| Python ortamı | uv 0.11.13 ile Python 3.11 |
| llama.cpp | CUDA SM_120 hedefiyle derlendi |
| Ollama | dört model, toplam ~246 GB |
| Open WebUI | systemd servisi, port 8080 |
| OpenSSH + Tailscale | uzaktan erişim |
Tablodaki sürümler kurulum tarihindekilerdir; sonraki güncellemelerde değişmiş olabilir.
llama.cpp'yi SM_120 hedefiyle derlemek Blackwell mimarisi için zorunlu. Hazır ikili dosyaların bir kısmı bu mimariyi tanımadığı için CPU'ya düşüyor ve kullanıcı GPU'yu satın almış olmasına rağmen yavaş bir sistemle kalıyor. Aynı durum Ollama'nın eski sürümleri için de geçerli.
Open WebUI'yi systemd servisi olarak tanımladık, böylece makine yeniden başladığında kullanıcı hiçbir komut yazmadan tarayıcıdan arayüze ulaşıyor.
Model seçimi
Dört model kuruldu: 30 milyar parametre sınıfında iki model, 120 milyar parametreli açık ağırlıklı bir model ve 235 milyar parametreli bir MoE modeli.
Buradan çıkan pratik ders şu: 235B'lik model 96 GB VRAM'e sığıyor, ama neredeyse tamamını doldurduğu için bağlam penceresi daralıyor ve yanıt hızı düşüyor. Günlük kullanımda 30B sınıfı modeller çok daha akıcı çalışıyor. "Sığıyor" ile "kullanışlı" aynı şey değil.
Bağlam penceresini büyütmek gerektiğinde flash attention'ı açıp KV cache'i q8 kuantizasyonuna almak belirgin fark yaratıyor.
Kurulumda karşılaştıklarımız
Secure Boot ve MOK kaydı. NVIDIA sürücüsü Secure Boot açık sistemlerde imzalanmış modül kaydı istiyor. Kurulum sırasında MOK enrollment adımı atlanırsa sistem yeniden başladığında sürücü yüklenmiyor ve ekran temel modda kalıyor.
Kurulum ISO'sundan kalan fstab kaydı. Ubuntu kurulumundan sonra /etc/fstab içinde kurulum medyasına ait bir mount satırı kalmıştı. Sistem, olmayan bir aygıtı bağlamaya çalıştığı için acil bakım kabuğuna düşüyordu. Satırı temizleyip normal açılışa döndük.
PCP servis kalıntıları. Performance Co-Pilot bileşenleri (pmie, pmcd, pmproxy, pmlogger) sürekli hata veriyordu. Bu makinede bir işlevleri olmadığı için tamamen kaldırdık; init script kalıntılarının elle temizlenmesi gerekti.
nvidia-prime çakışması. Sürücü güncellemesi sırasında paket çakışması çıktı. Tek GPU'lu masaüstü sistemlerde prime yönetimi gerekmediği için kaldırılması en temiz çözüm.
Teslim
Kurulum sonunda hazırladığımız rapor şunları içeriyor: tüm bileşenlerin seri numaraları (anakart, bellek modülleri tek tek, NVMe, GPU'nun seri numarası ve UUID'si), kurulan yazılımların sürüm tablosu, indirilen modeller ve boyutları, model seçimi konusundaki önerilerimiz.
Sistem teslim edildiğinde kullanıcı tarayıcıdan tek adrese girip modelle konuşabiliyor. Arkasındaki katmanlarla uğraşması gerekmiyor.
Rehberlerden devam edin
Aynı performansı sizin için de kuralım
Kullandığınız uygulamaları ve iş akışınızı anlatın; sistemi ona göre boyutlandıralım.