BOXX Türkiye distribütörü+90 850 303 26 99[email protected]DestekGiriş
BOXX Türkiye
Proje anlatımları

Kurumsal AI iş istasyonu: 96 GB VRAM üzerinde özel LLM ortamı

RTX PRO 6000 Blackwell tabanlı bir iş istasyonuna Ubuntu 24.04, CUDA yığını ve dört büyük dil modeli kuruldu. Kurumun verisi dışarı çıkmadan çalışan bir çıkarım ortamı.

BOXX Türkiye ·

Kurumların büyük bir kısmı yapay zekâyı kullanmak istiyor ama verisini bulut sağlayıcısına göndermek istemiyor. Bu projede tek bir iş istasyonuna, kurum içinde kalan ve dışarıya hiçbir veri göndermeyen bir dil modeli ortamı kurduk.

Donanım

BileşenSeçim
AnakartASUS ProArt Z890-CREATOR WIFI
İşlemciIntel Core Ultra 9 285K
Bellek256 GB DDR5 (4 × 64 GB)
DepolamaSamsung 9100 PRO 4 TB NVMe
GPUNVIDIA RTX PRO 6000 Blackwell, 96 GB VRAM

Buradaki kritik bileşen tek başına GPU. 96 GB VRAM, 100 milyar parametre sınıfındaki modelleri tek kartta çalıştırabilecek tek iş istasyonu kartı seviyesi. Sistem belleğinin 256 GB olması ise model yükleme sırasında ve büyük veri setleriyle çalışırken nefes payı bırakıyor.

Yazılım yığını

Ubuntu 24.04 LTS üzerine kurduk. Kurulan katmanlar:

KatmanSürüm / Detay
NVIDIA sürücüsü580.159.03
CUDA Toolkit12.8
cuDNN9
NCCLkurulu
Docker + NVIDIA Container Toolkitkurulu
Python ortamıuv 0.11.13 ile Python 3.11
llama.cppCUDA SM_120 hedefiyle derlendi
Ollamadört model, toplam ~246 GB
Open WebUIsystemd servisi, port 8080
OpenSSH + Tailscaleuzaktan erişim

Tablodaki sürümler kurulum tarihindekilerdir; sonraki güncellemelerde değişmiş olabilir.

llama.cpp'yi SM_120 hedefiyle derlemek Blackwell mimarisi için zorunlu. Hazır ikili dosyaların bir kısmı bu mimariyi tanımadığı için CPU'ya düşüyor ve kullanıcı GPU'yu satın almış olmasına rağmen yavaş bir sistemle kalıyor. Aynı durum Ollama'nın eski sürümleri için de geçerli.

Open WebUI'yi systemd servisi olarak tanımladık, böylece makine yeniden başladığında kullanıcı hiçbir komut yazmadan tarayıcıdan arayüze ulaşıyor.

Model seçimi

Dört model kuruldu: 30 milyar parametre sınıfında iki model, 120 milyar parametreli açık ağırlıklı bir model ve 235 milyar parametreli bir MoE modeli.

Buradan çıkan pratik ders şu: 235B'lik model 96 GB VRAM'e sığıyor, ama neredeyse tamamını doldurduğu için bağlam penceresi daralıyor ve yanıt hızı düşüyor. Günlük kullanımda 30B sınıfı modeller çok daha akıcı çalışıyor. "Sığıyor" ile "kullanışlı" aynı şey değil.

Bağlam penceresini büyütmek gerektiğinde flash attention'ı açıp KV cache'i q8 kuantizasyonuna almak belirgin fark yaratıyor.

Kurulumda karşılaştıklarımız

Secure Boot ve MOK kaydı. NVIDIA sürücüsü Secure Boot açık sistemlerde imzalanmış modül kaydı istiyor. Kurulum sırasında MOK enrollment adımı atlanırsa sistem yeniden başladığında sürücü yüklenmiyor ve ekran temel modda kalıyor.

Kurulum ISO'sundan kalan fstab kaydı. Ubuntu kurulumundan sonra /etc/fstab içinde kurulum medyasına ait bir mount satırı kalmıştı. Sistem, olmayan bir aygıtı bağlamaya çalıştığı için acil bakım kabuğuna düşüyordu. Satırı temizleyip normal açılışa döndük.

PCP servis kalıntıları. Performance Co-Pilot bileşenleri (pmie, pmcd, pmproxy, pmlogger) sürekli hata veriyordu. Bu makinede bir işlevleri olmadığı için tamamen kaldırdık; init script kalıntılarının elle temizlenmesi gerekti.

nvidia-prime çakışması. Sürücü güncellemesi sırasında paket çakışması çıktı. Tek GPU'lu masaüstü sistemlerde prime yönetimi gerekmediği için kaldırılması en temiz çözüm.

Teslim

Kurulum sonunda hazırladığımız rapor şunları içeriyor: tüm bileşenlerin seri numaraları (anakart, bellek modülleri tek tek, NVMe, GPU'nun seri numarası ve UUID'si), kurulan yazılımların sürüm tablosu, indirilen modeller ve boyutları, model seçimi konusundaki önerilerimiz.

Sistem teslim edildiğinde kullanıcı tarayıcıdan tek adrese girip modelle konuşabiliyor. Arkasındaki katmanlarla uğraşması gerekmiyor.

Bu yazı BOXX Türkiye ekibi tarafından, kendi kurulum ve proje deneyiminden yazılmıştır. Müşteri adları yazılı izin olmadan verilmez.
Diğer rehberler

Rehberlerden devam edin

Proje süreci

BOXX'ta bir proje nasıl yürür

Proje süreci

Garanti, RMA ve destek

Proje anlatımları

8 GPU'lu AI çıkarım sunucusu: 671 milyar parametreli modeli yerelde çalıştırmak

Sizin iş akışınız

Aynı performansı sizin için de kuralım

Kullandığınız uygulamaları ve iş akışınızı anlatın; sistemi ona göre boyutlandıralım.