Ana içeriğe geç

VRAM Hesaplayıcı Kullanım Kılavuzu

Bu rehber, Cordatus Platform üzerinde bulunan VRAM Calculator aracının nasıl kullanılacağını açıklar.

VRAM Calculator, hangi LLM (Large Language Model)'in hangi GPU'da belirli yapılandırmalarla çalışabileceğini belirlemenize yardımcı olan güçlü bir araçtır. Bu araç, model ağırlıkları, KV Cache, activation belleği ve sistem yükü gibi faktörleri dikkate alarak GPU VRAM gereksinimlerini hesaplar ve dağıtımlarınızı önceden planlamanıza olanak tanır.

Ayrıntılar için bakınız → Application Hub Overview | Application Hub Quickstart | Standard Application Launch Guide | NVIDIA AI Dynamo Guide | User Models Guide


VRAM Calculator Nedir?

VRAM Calculator, bir LLM modelini çalıştırmak için gereken toplam GPU belleğini hesaplayan ve bu belleğin nasıl dağıtıldığını görselleştiren bir araçtır.

VRAM Calculator Complete Guide

 

Hesaplamalar aşağıdaki bileşenleri içerir:

  • Model Weights: Modelin parametrelerinin kapladığı bellek alanı
  • KV Cache: Transformer modellerinde kullanılan Key-Value cache
  • Overhead/Activation Memory: Sistem yükü veya activation belleği
  • Free VRAM: Kalan kullanılabilir bellek alanı

3. VRAM Calculator'a Erişim

VRAM Calculator'a iki farklı şekilde erişebilirsiniz:

  1. Standalone Mode: Ana menüden VRAM Calculator seçeneğini seçerek bağımsız olarak kullanabilirsiniz.

  2. Device Mode: Belirli bir cihaza bağlandıktan sonra, o cihazın GPU'larını kullanarak hesaplamalar yapabilirsiniz.


4. Model Seçimi

4.1 Kayıtlı Modeller

VRAM Calculator, Cordatus sisteminde önceden tanımlanmış ve test edilmiş LLM modellerini listeler.

  • Model Selection: İstediğiniz modeli açılır menüden seçin
  • Bir model seçildiğinde, sistemde kayıtlı model parametreleri (hidden_size, num_params, attention_heads vb.) otomatik olarak yüklenir

4.2 Yeni Model Ekleme (Search Huggingface Model)

İstediğiniz model sistemde kayıtlı değilse, Search Huggingface Model özelliğini kullanabilirsiniz.

Desteklenen Formatlar:

  1. Hugging Face URL: https://huggingface.co/meta-llama/Llama-2-7b-hf

  2. Model Name: meta-llama/Llama-2-7b-hf

Kullanım Adımları:

  1. Model adını veya URL'sini Search Huggingface Model alanına yapıştırın
  2. Find düğmesine tıklayın
  3. Model başarıyla bulunursa:
    • Model, kayıtlı modeller listesine otomatik olarak eklenir
    • Model parametreleri Hugging Face API'sinden alınır
    • Bir başarı mesajı görüntülenir (örn. "Model 'meta-llama/Llama-2-7b-hf' found with 7B parameters")
  4. Model bulunamazsa, bir hata mesajı görüntülenir

💡 Not: Bu özellik sayesinde hem Cordatus sistemine katkıda bulunabilir hem de VRAM Calculator'da kullanılmak üzere yeni modeller ekleyebilirsiniz.


5. GPU Seçimi

5.1 Bağımsız Mod

GPU modelini açılır menüden seçin. Cordatus sisteminde kayıtlı GPU modelleri ve VRAM kapasiteleri listelenir:

  • NVIDIA A100 (80GB)
  • NVIDIA H100 (80GB)
  • NVIDIA V100 (32GB)
  • NVIDIA RTX 4090 (24GB)
  • ve diğer GPU modelleri

5.2 Cihaz Modu

Device mode'da, bağlı cihazın gerçek GPU'ları otomatik olarak tespit edilir ve listelenir:

  • GPU adı ve VRAM kapasitesi görüntülenir
  • Birden fazla GPU varsa, tümü varsayılan olarak seçilir
  • İstenen GPU'ları kaldırarak özelleştirebilirsiniz
  • Seçilen GPU'ların toplam VRAM kapasitesi otomatik olarak hesaplanır

⚙️ Önemli: Device Mode'da GPU sayısı otomatik olarak belirlenir ve GPU Count ayarı devre dışı bırakılır.


6. Yapılandırma Ayarları

Bir model ve GPU seçtikten sonra, temel yapılandırmalar otomatik olarak tanımlanır ve hesaplama başlar. Aşağıdaki parametreleri özelleştirebilirsiniz:

6.1 GPU Sayısı

⚠️ Not: Bu ayar yalnızca Standalone Mode'da kullanılabilir. Device Mode'da, seçilen GPU sayısı otomatik olarak belirlenir.

  • Açıklama: Modeli çalıştırmak için kullanılacak GPU sayısı
  • Varsayılan Değer: 1
  • Kullanım: Birden fazla GPU kullanarak toplam VRAM kapasitesini artırabilirsiniz
  • Etki: Total System VRAM = GPU VRAM × GPU Count × GPU Memory Utilization

Örnek:

  • 1 × NVIDIA A100 (80GB) = 80GB toplam VRAM
  • 4 × NVIDIA A100 (80GB) = 320GB toplam VRAM

6.2 Kuantizasyon

  • Açıklama: Model ağırlıklarının bellekte saklandığı format

  • Varsayılan Değer: BF16 (16-bit Brain Floating Point)

  • Seçenekler:

    • BF16 (16-bit): En yüksek doğruluk, en yüksek bellek kullanımı
    • FP16 (16-bit): Yüksek doğruluk, yüksek bellek kullanımı
    • FP8 (8-bit): Orta doğruluk, orta bellek kullanımı
    • INT8 (8-bit): İyi doğruluk, düşük bellek kullanımı
    • FP4 (4-bit): Düşük doğruluk, minimum bellek kullanımı
    • INT4 (4-bit): En düşük doğruluk, minimum bellek kullanımı
  • Etki: Quantization değeri azaldıkça:

    • Model ağırlıkları daha az yer kaplar
    • Daha büyük modelleri daha küçük GPU'larda çalıştırabilirsiniz
    • Model doğruluğu düşebilir

Hesaplama:

Model Weight Size = (Num Parameters × Quantization Bits) / 8 / (1024³)

Örnek:

  • 7B parametreli model
  • FP16 (16-bit): 7B × 16 / 8 = 14GB
  • INT8 (8-bit): 7B × 8 / 8 = 7GB
  • INT4 (4-bit): 7B × 4 / 8 = 3.5GB

6.3 Dizi Uzunluğu

  • Açıklama: Modelin bir seferde işleyebileceği maksimum token sayısı
  • Varsayılan Değer: 1024
  • Aralık: 1024 - 262144 (9 farklı değere sahip kaydırıcı: 1K, 2K, 4K, 8K, 16K, 32K, 64K, 128K, 256K)
  • Manuel Giriş: Kaydırıcı yerine doğrudan bir sayı girebilirsiniz
  • Etki:
    • KV Cache boyutunu doğrudan etkiler
    • Activation Memory boyutunu etkiler
    • Daha uzun sequence daha fazla VRAM gerektirir

KV Cache Hesaplaması:

KV Cache = (Batch Size × Sequence Length × Num Key-Value Heads × Head Dimension × 2 × Num Layers × Quantization Bytes) / GB

Activation Memory Hesaplaması:

Activation = (Sequence Length × Batch Size × (18 × Hidden Size + 4 × Intermediate Size)) / GB

Örnek Kullanım Senaryoları:

  • 1024-2048: Kısa sohbetler, hızlı yanıtlar
  • 4096-8192: Orta uzunlukta metinler, kod üretimi
  • 16384-32768: Uzun belgeler, detaylı analiz
  • 65536+: Çok uzun metinler, kitap analizi

6.4 Batch Boyutu

  • Açıklama: Aynı anda paralel olarak işlenecek istek sayısı
  • Varsayılan Değer: 1
  • Aralık: 1 - 512 (veya daha fazla)
  • Etki:
    • KV Cache boyutunu doğrudan etkiler
    • Activation Memory boyutunu etkiler
    • Daha yüksek batch size daha fazla verim ancak daha fazla VRAM anlamına gelir

Örnek:

  • Batch Size = 1: Tek kullanıcı, düşük VRAM
  • Batch Size = 8: 8 paralel istek, orta VRAM
  • Batch Size = 32: Yüksek verim, yüksek VRAM

6.5 GPU Bellek Kullanımı

  • Açıklama: GPU'nun toplam VRAM'inin ne kadarının model için kullanılacağı
  • Varsayılan Değer: 0.90 (%90)
  • Aralık: 0.0 - 1.0 (%0 - %100)
  • Kaydırıcı Adımı: 0.01 (%1)
  • Neden %100 Değil?
    • GPU işletim sistemi ve sürücüleri bellek gerektirir
    • CUDA çekirdekleri ve diğer sistem işlemleri için alan gereklidir
    • %90-95 optimal aralıktır

Etki:

Available System VRAM = GPU VRAM × GPU Count × GPU Memory Utilization

Örnek:

  • NVIDIA A100: 80GB × 0.90 = 72GB kullanılabilir VRAM
  • NVIDIA A100: 80GB × 1.0 = 80GB kullanılabilir VRAM (riskli)

6.6 Hesaplama Türü

İki farklı overhead hesaplama yöntemi sunulur:

Overhead (Basit Yaklaşım)

  • Model ağırlıklarının %20'sine eşit bir overhead ekler
  • Hesaplama: Overhead = Model Weights × 0.20
  • Kullanım: Hızlı ve basit tahmin için
  • Avantaj: Anlaşılması kolay
  • Dezavantaj: Daha az hassas

Activation (Detaylı Yaklaşım)

  • Sabit 1.5GB + Activation Memory
  • Hesaplama: Overhead = 1.5 GB + Activation Memory
  • Activation Memory, model mimarisine ve sequence/batch parametrelerine bağlıdır
  • Kullanım: Daha doğru hesaplama için
  • Avantaj: Daha doğru sonuçlar
  • Dezavantaj: Daha karmaşık

💡 Öneri: Üretim ortamları için Activation modunu kullanın.


7. Sonuçlar Ekranı

7.1 Özet İstatistikler (Stats Grid)

Üstte 3 sütunlu bir grid görüntülenir:

  1. Model Weights

    • 🔵 Mavi simge
    • Model parametrelerinin kapladığı alan
    • GB olarak görüntülenir
  2. KV Cache

    • 🟡 Turuncu simge
    • Key-Value cache boyutu
    • Sequence length ve batch size'a göre değişir
  3. Overhead / Activation

    • 🟠 Amber simge
    • Sistem yükü veya activation belleği
    • Seçilen hesaplama türüne göre değişir
  4. Required VRAM

    • 🔴 Kırmızı simge
    • Toplam gereken VRAM
    • Weights + KV Cache + Overhead toplamı
    • Yetersizse kırmızı ile vurgulanır
  5. Available VRAM

    • 🟢 Yeşil simge
    • Sistemde kullanılabilir toplam VRAM
    • GPU VRAM × GPU Count × Utilization
    • Yeterliyse yeşil ile vurgulanır
  6. Free VRAM

    • 🔵 Mavi-yeşil simge
    • Model yüklendikten sonra kalan boş alan
    • Available - Required

7.2 Grafik (Doughnut Chart)

Solda dairesel bir grafik görüntülenir:

Grafik Bileşenleri:

  • 🔵 Mavi Dilim: Model Weights
  • 🟠 Turuncu Dilim: Overhead
  • 🟡 Sarı Dilim: KV Cache
  • 🟢 Yeşil Dilim: Free VRAM

Grafik Durumları:

  • No Data: Gri "No Data" görüntülenir
  • Sufficient VRAM: Yeşil dilim görünür
  • Insufficient VRAM: Yeşil dilim görünmez, yalnızca kullanılan alanlar gösterilir

7.3 Detaylı Metrikler

Sağda detaylı bir metrik listesi görüntülenir:

  1. Model Weights: Model ağırlıklarının GB cinsinden boyutu
  2. Overhead: Sistem yükü (hesaplama türüne göre)
  3. KV Cache: Key-Value cache boyutu
  4. Activation Memory: Activation belleği (Activation modunda)
  5. Free VRAM: Kalan boş alan (yeşil ile vurgulanır)

Usage Bar:

  • Gereken VRAM'in toplam VRAM'e oranı
  • Yüzde olarak gösterilir
  • %100'ün altında: Mor renk (✅ Yeterli)
  • %100'ün üstünde: Kırmızı renk (❌ Yetersiz)

7.4 Durum Özeti

Altta büyük bir durum kartı görüntülenir:

Yeterli VRAM

  • ✅ Yeşil simge ve çerçeve
  • Başlık: "VRAM is Sufficient"
  • Açıklama: Toplam gereken VRAM ve kullanılabilir VRAM bilgisi
  • Renk: Yeşil tonlar

Örnek Mesaj:

✅ VRAM is Sufficient
Your configuration requires 45.2 GB of VRAM,
and you have 72.0 GB available.

Yetersiz VRAM

  • ❌ Kırmızı simge ve çerçeve
  • Başlık: "VRAM is Insufficient"
  • Açıklama: Toplam gereken VRAM ve kullanılabilir VRAM bilgisi
  • Öneriler: GPU sayısını artırın veya quantization seviyesini düşürün

Örnek Mesaj:

❌ VRAM is Insufficient
Your configuration requires 95.8 GB of VRAM,
but you only have 72.0 GB available.