VRAM Hesaplayıcı
VRAM Hesaplayıcı, herhangi bir şey dağıtmadan önce tek bir soruyu yanıtlar: bu model, bu ayarlarla, bu GPU'ya sığar mı? Gereksinimi model ağırlıkları, KV önbelleği, aktivasyon belleği ve ek yük olarak ayırır ve geriye ne kaldığını söyler.
LLM Başlatıcı → VRAM Hesaplayıcı, ya da bir cihazın içindeki VRAM Hesap sekmesi; orada o cihazın gerçek GPU'larıyla önceden doldurulmuş gelir.
Yapılandırma
Soldaki panel tüm girdileri barındırır. Sonuçlar siz değiştirdikçe güncellenir.
Model
Hugging Face metin üretimi modellerini arayın. En az birkaç karakter yazın — siz yazana kadar alan "Model aramak için yazın", çalışırken "Aranıyor…" der. Bir model seçmek parametrelerini (hidden size, katman sayısı, dikkat başlıkları, ara boyut) otomatik olarak getirir; böylece hesaplama tahmin yerine modelin gerçek mimarisini kullanır.
Model kimliğini (meta-llama/Llama-2-7b-hf) ya da tam URL'sini yapıştırabilirsiniz.
GGUF Nicemleme
Seçilen depo GGUF dosyaları içeriyorsa GGUF rozetli ek bir alan belirir:
Çalıştırmak istediğiniz GGUF nicemleme dosyasını seçin. Her kayıt yaklaşık ağırlık başına bit
sayısını gösterir (~4.5 bits/weight); daha düşük bitli nicemlemeler daha az VRAM kullanır ama
kaliteyi düşürebilir. Bir dosyanın bit genişliği belirlenemiyorsa bits/weight unknown olarak
listelenir.
Depoda GGUF dosyası yoksa alan "GGUF dosyası bulunamadı" der ve bunun yerine olağan nicemleme seçici kullanılır.
GPU
Katalogdan bir GPU seçin ya da gerçek donanımı kullanın:
- Cihaz GPU'larını Seç, bağlı cihazlarınızdan birinin GPU'larını okur. Bu kayıtlar listede Cihaz rozetiyle işaretlenir.
- GPU Sayısı — o GPU'dan kaç adet kullanılacağı. Daha fazla GPU, model paralelliği yoluyla daha büyük modellere izin verir.
Nicemleme
Model ağırlıklarının kesinlik biçimi. Daha düşük kesinlik (örneğin INT4) daha az VRAM kullanır ama doğruluğu düşürebilir; FP16/BF16 tam kesinliktir.
Dizi Uzunluğu
Token cinsinden azami bağlam uzunluğu. Daha uzun diziler KV önbelleği için daha fazla VRAM gerektirir — rahat bir sığmayı sıkışık hâle getiren ayar genellikle budur.
Batch Boyutu
Aynı anda kaç isteğin işlendiği. Yüksek batch boyutları verimi artırır ama KV önbelleği için daha fazla VRAM ister.
GPU Bellek Kullanımı
GPU VRAM'inin modele ayrılan yüzdesi. Sistem ek yükü ve CUDA işlemleri için %10–20 pay bırakın.
Hesaplama Türü
| Seçenek | Ne yapar |
|---|---|
| %20 Ek Yük | Basit tahmin: ağırlıklar artı %20 tampon. Hızlı, bilinçli olarak temkinli. |
| Aktivasyon Dahil | Daha isabetli: çıkarım sırasında gerçekten kullanılan aktivasyon belleğini, dizi uzunluğu, batch boyutu, hidden size ve ara boyuttan hesaplayarak dâhil eder. |
Marj önemli olduğunda Aktivasyon Dahil'i kullanın.
Sonuçlar
Özet kartları
Üstte: Model, Nicemleme, Batch Boyutu, Gereken VRAM ve Kullanılabilir VRAM.
VRAM Dağılımı
Belleğin nereye gittiğini gösteren bir halka grafik.
Bellek Detayları
| Bileşen | Anlamı |
|---|---|
| Model Ağırlıkları | Seçilen nicemlemede modelin parametrelerinin kapladığı bellek. |
| KV Önbelleği | Dizi uzunluğu ve batch boyutuna bağlı anahtar/değer önbelleği. |
| Ek Yük | %20 Ek Yük modundaki sabit tampon. |
| Etkinleştirmeler | Aktivasyon Dahil modunda çıkarım sırasındaki aktivasyon belleği. |
| Boş VRAM | Geriye kalan. |
Kullanım
Yapılandırmanın kullanılabilir VRAM'in ne kadarını gerektirdiğini gösteren bir çubuk ve karar:
- VRAM Yeterli — sığıyor.
- VRAM Yetersiz — sığmıyor. Nicemlemeyi düşürün, dizi uzunluğunu kısaltın, batch boyutunu azaltın ya da GPU ekleyin.
Üretimde %20–30 boş VRAM bırakın. Tam %100'de sığan bir yapılandırma, test ettiğinizden daha uzun bir istem geldiği anda başarısız olur.
Bunun başlatma sihirbazıyla ilişkisi
Sihirbazın kendi hafif kontrolü vardır: Model bölmesindeki GPU uyum danışmanı; yalnızca ağırlık boyutundan tahmin eder ve bir modelin kaç GPU gerektirdiğini söyler. Model seçerken hızlı bir karar için onu kullanın.
Tam resme ihtiyacınız olduğunda buraya gelin — bağlam uzunluğunun ve batch boyutunun KV önbelleğine etkisi ya da henüz sahip olmadığınız bir donanımda iki nicemlemenin karşılaştırılması.
Ayrıca bkz.: Başlatma Rehberi · AI Başlatma
Tipik kullanımlar
- Donanım almadan önce — sahip olmadığınız GPU'larda modeli deneyin.
- Üretim dağıtımından önce — sunmayı düşündüğünüz bağlam uzunluğu ve batch boyutunun gerçekten sığdığını doğrulayın.
- Nicemleme seçerken — aynı model ve aynı kart üzerinde BF16, FP8 ve INT4'ü karşılaştırın.
- Çoklu GPU planlarken — model sığana kadar GPU Sayısı'nı artırın ve ne kadar pay kaldığını görün.