8 GPU'lu AI çıkarım sunucusu: 671 milyar parametreli modeli yerelde çalıştırmak
Çift EPYC 9655, 1 TB bellek, 8 adet RTX PRO 6000 Blackwell. Sekizinci kartın sisteme görünmeme hikâyesi ve DeepSeek R1 671B’nin saniyede 25 token ile çalıştırılması.
Bu, kurduğumuz en zorlu sistemlerden biriydi. Amaç, kurum içinde çalışan ve dışarıya bağlanmayan büyük ölçekli bir çıkarım sunucusuydu. Hedef model 671 milyar parametreli DeepSeek R1'di.
Konfigürasyon
| Bileşen | Seçim |
|---|---|
| Platform | ASRock Rack 4U8G-TURIN2 |
| Anakart | TURIN2D24G-2L+ |
| İşlemci | 2 × AMD EPYC 9655 (toplam 192 çekirdek) |
| Bellek | 1024 GB DDR5 ECC, 5600 MT/s |
| GPU | 8 × NVIDIA RTX PRO 6000 Blackwell (toplam 768 GB VRAM) |
| Depolama | Kingston DC3000ME 3.84 TB U.2 PCIe 5.0 NVMe |
| İşletim sistemi | Ubuntu 24.04 LTS |
Sekiz kartlı bir sistemin dört kartlının iki katı olmadığını bu projede bir kez daha gördük. PCIe enumerasyonu, güç dağıtımı ve BIOS tarafı belirli bir kart sayısından sonra tamamen başka bir problem sınıfına giriyor.
Açılmayan sistem
Sistem ilk kurulduğunda POST sırasında A2 kodunda kilitleniyordu. Kod, IDE/SATA aygıt tespiti aşamasına işaret ediyor. Kaynağı anakart üzerindeki ek SATA denetleyicisinin option ROM'unun sürücü başlatma sırasında zaman aşımına uğramasıydı.
Kart sayısını sekizden dörde indirip tekrar çıkardıktan sonra ikinci bir sorun ortaya çıktı: NVRAM'deki PCIe BAR tablosu bozulmuştu. Çözüm CMOS temizliğiydi; bu anakartta CLRMOS1 temas noktasının pil çıkarılmış haldeyken on saniye kısa devre edilmesi gerekiyor. Aynı sırada BMC de video başlatma döngüsüne girdi, UID düğmesinin on saniye basılı tutulmasıyla fabrika ayarına döndü.
Asıl inatçı sorun bundan sonraydı. Sekiz kart takılıyken sistem 0x92 kodunda, yani PCIe veri yolu başlatma aşamasında takılıyordu ve tekrarlayan bir link training döngüsüne giriyordu. Sekizinci kart hangi fiziksel yuvaya takılırsa takılsın sonuç değişmiyordu; belirli bir kartın arızası değil, enumerasyon sınırıydı.
Bu noktada ASRock Rack destek ekibiyle temasa geçtik. Kamuya açık BIOS sürümü 11.01 idi; o tarihte henüz yayınlanmamış 11.09 sürümünü ilettiler ve sekiz kartlı açılış sorunu tamamen ortadan kalktı.
Buradan çıkan ders, üretici destek kanalına doğrudan erişimin bir konfor değil gereklilik olduğu. Aynı sorunu forumlarda arayarak çözmenin bir yolu yoktu, çünkü çözüm henüz yayınlanmamıştı.
BIOS tarafında not düşülmesi gereken iki ayar: MCIO10/MCIO9 yuvaları varsayılan olarak x8x8 bifurcation'da geliyor, Chipset Configuration altındaki PCIE Link Width menüsünden değiştiriliyor. Above 4G Decoding ise bu platformda ayrı bir seçenek olarak görünmüyor, EPYC Turin'de platform seviyesinde daima açık.
671B modeli çalıştırmak
Donanım kararlı hale geldikten sonra Ollama kuruldu ve DeepSeek R1 671B Q4_K_M indirildi. Standart ollama run komutu çalışmadı: model, GPU ve sistem belleği toplamında yaklaşık 1 TB alan talep ediyordu.
Çözüm, indirilmiş blob üzerinden özel bir Modelfile tanımlamak oldu. Katman dağılımını elle belirledik (num_gpu 61), bağlam penceresini 8192'ye sabitledik ve sıcaklığı modelin önerdiği 0.6 değerine çektik. Bu yapılandırmayla sekiz GPU üzerinde saniyede 25,64 token çıkarım hızı ölçtük (ölçüm, kurulum tarihindeki Modelfile ile yapıldı).
Arayüz tarafında Docker, NVIDIA Container Toolkit ve Open WebUI kuruldu. Burada bir detay var: Ollama varsayılan olarak yalnızca localhost'u dinlediği için Docker konteyneri servise ulaşamıyor. systemctl edit ollama ile OLLAMA_HOST=0.0.0.0 tanımlandıktan sonra Open WebUI, Docker köprü adresi üzerinden bağlanabildi.
Sonuç
Kurum, 671 milyar parametreli bir modeli kendi sunucu odasında, hiçbir veri dışarı çıkmadan çalıştırıyor. Sekiz kartlı bir sistemin devreye alınması ise sadece parçaların takılmasından ibaret değil; BIOS, firmware ve platform davranışının bilinmesini gerektiriyor.
Rehberlerden devam edin
Aynı performansı sizin için de kuralım
Kullandığınız uygulamaları ve iş akışınızı anlatın; sistemi ona göre boyutlandıralım.