Ga naar hoofdinhoud

VRAM-calculator

De VRAM-calculator beantwoordt één vraag voordat u iets uitrolt: past dit model, met deze instellingen, op deze GPU? Hij splitst de behoefte op in modelgewichten, KV-cache, activatiegeheugen en overhead, en vertelt wat er overblijft.

LLM Launcher → VRAM-calculator, of het tabblad VRAM-calc binnen een apparaat, waar hij al is ingevuld met de echte GPU's van dat apparaat.

Qwen3-8B op een RTX 4090: de context naar 16K tillen breekt de pasvorm, een tweede GPU herstelt hem

 


Configuratie

Het linkerpaneel bevat alle invoer. De resultaten worden bijgewerkt terwijl u die wijzigt.

Model

Zoek Hugging Face-modellen voor tekstgeneratie. Typ ten minste enkele tekens — het veld zegt "Typ om modellen te zoeken" tot u dat doet, en "Zoeken…" terwijl het bezig is. Een model selecteren haalt automatisch de parameters op (hidden size, lagen, attention heads, intermediate size), zodat de berekening de echte architectuur van het model gebruikt in plaats van een schatting.

U kunt de model-id (meta-llama/Llama-2-7b-hf) of de volledige URL plakken.

GGUF-kwantisatie

Bevat de geselecteerde repository GGUF-bestanden, dan verschijnt een extra veld met een GGUF-badge: Selecteer het GGUF-kwantisatiebestand dat u wilt draaien. Elk item toont het geschatte aantal bits per gewicht (~4.5 bits/weight); kwantisaties met minder bits gebruiken minder VRAM maar kunnen de kwaliteit verlagen. Kan de bitbreedte van een bestand niet worden bepaald, dan staat het vermeld als bits/weight unknown.

Bevat de repository geen GGUF-bestanden, dan meldt het veld "Geen GGUF-bestanden gevonden" en wordt in plaats daarvan de gewone kwantisatiekiezer gebruikt.

GPU

Kies een GPU uit de catalogus of gebruik de echte hardware:

  • GPU's van het apparaat selecteren leest de GPU's van een van uw verbonden apparaten. Die items zijn in de lijst gemarkeerd met een badge Apparaat.
  • Aantal GPU's — hoeveel van die GPU u wilt gebruiken. Meer GPU's maken grotere modellen mogelijk via modelparallelisme.

Kwantisatie

Het precisieformaat voor de modelgewichten. Lagere precisie (bijvoorbeeld INT4) gebruikt minder VRAM maar kan de nauwkeurigheid verlagen; FP16/BF16 is volledige precisie.

Sequentielengte

De maximale contextlengte in tokens. Langere sequenties vragen meer VRAM voor de KV-cache — dit is meestal de instelling die een ruime pasvorm krap maakt.

Batchgrootte

Hoeveel verzoeken tegelijk worden verwerkt. Grotere batches verhogen de doorvoer maar vragen meer VRAM voor de KV-cache.

GPU-geheugenbenutting

Het percentage van het GPU-VRAM dat beschikbaar is voor het model. Reserveer 10–20% voor systeemoverhead en CUDA-bewerkingen.

Berekeningstype

OptieWat het doet
20% overheadEenvoudige schatting: gewichten plus een buffer van 20%. Snel en bewust behoudend.
Met activatieNauwkeuriger: neemt het activatiegeheugen mee dat tijdens inferentie werkelijk wordt gebruikt, berekend uit sequentielengte, batchgrootte, hidden size en intermediate size.

Gebruik Met activatie wanneer de marge ertoe doet.


Resultaten

Samenvattingstegels

Bovenaan: Model, Kwantisatie, Batchgrootte, Vereist VRAM en Beschikbaar VRAM.

VRAM-verdeling

Een ringdiagram van waar het geheugen naartoe gaat.

Geheugendetails

OnderdeelBetekenis
ModelgewichtenHet geheugen dat de parameters van het model innemen bij de gekozen kwantisatie.
KV-cacheDe key/value-cache, bepaald door sequentielengte en batchgrootte.
OverheadDe vaste buffer, in de modus 20% overhead.
ActiveringenActivatiegeheugen tijdens inferentie, in de modus Met activatie.
Vrij VRAMWat er overblijft.

Benutting

Een balk die toont welk deel van het beschikbare VRAM de configuratie nodig heeft, en het oordeel:

  • VRAM is voldoende — het past.
  • VRAM is onvoldoende — het past niet. Verlaag de kwantisatie, verkort de sequentielengte, verklein de batchgrootte of voeg GPU's toe.
tip

Houd in productie 20–30% VRAM vrij. Een configuratie die precies op 100% past, faalt zodra er een verzoek binnenkomt met een langere prompt dan waarmee u hebt getest.


Hoe dit zich verhoudt tot de startwizard

De wizard heeft zijn eigen, lichtere controle: de GPU-adviseur in het paneel Model, die schat op basis van alleen de gewichtsgrootte en zegt hoeveel GPU's een model nodig heeft. Gebruik die voor een snel oordeel tijdens het kiezen van een model.

Kom hier wanneer u het volledige plaatje nodig hebt — het effect van contextlengte en batchgrootte op de KV-cache, of een vergelijking tussen twee kwantisaties op hardware die u nog niet hebt.

Zie ook: Starthandleiding · AI-start


Typische toepassingen

  • Vóór hardware-aankoop — probeer het model op GPU's die u niet hebt.
  • Vóór een productie-uitrol — bevestig dat de contextlengte en batchgrootte die u wilt bedienen daadwerkelijk passen.
  • Bij het kiezen van een kwantisatie — vergelijk BF16, FP8 en INT4 voor hetzelfde model op dezelfde kaart.
  • Bij het plannen van meerdere GPU's — verhoog het aantal GPU's tot het model past en zie hoeveel ruimte er overblijft.