VRAM-calculator
De VRAM-calculator beantwoordt één vraag voordat u iets uitrolt: past dit model, met deze instellingen, op deze GPU? Hij splitst de behoefte op in modelgewichten, KV-cache, activatiegeheugen en overhead, en vertelt wat er overblijft.
LLM Launcher → VRAM-calculator, of het tabblad VRAM-calc binnen een apparaat, waar hij al is ingevuld met de echte GPU's van dat apparaat.
Configuratie
Het linkerpaneel bevat alle invoer. De resultaten worden bijgewerkt terwijl u die wijzigt.
Model
Zoek Hugging Face-modellen voor tekstgeneratie. Typ ten minste enkele tekens — het veld zegt "Typ om modellen te zoeken" tot u dat doet, en "Zoeken…" terwijl het bezig is. Een model selecteren haalt automatisch de parameters op (hidden size, lagen, attention heads, intermediate size), zodat de berekening de echte architectuur van het model gebruikt in plaats van een schatting.
U kunt de model-id (meta-llama/Llama-2-7b-hf) of de volledige URL plakken.
GGUF-kwantisatie
Bevat de geselecteerde repository GGUF-bestanden, dan verschijnt een extra veld met een
GGUF-badge: Selecteer het GGUF-kwantisatiebestand dat u wilt draaien. Elk item toont het
geschatte aantal bits per gewicht (~4.5 bits/weight); kwantisaties met minder bits gebruiken minder
VRAM maar kunnen de kwaliteit verlagen. Kan de bitbreedte van een bestand niet worden bepaald, dan
staat het vermeld als bits/weight unknown.
Bevat de repository geen GGUF-bestanden, dan meldt het veld "Geen GGUF-bestanden gevonden" en wordt in plaats daarvan de gewone kwantisatiekiezer gebruikt.
GPU
Kies een GPU uit de catalogus of gebruik de echte hardware:
- GPU's van het apparaat selecteren leest de GPU's van een van uw verbonden apparaten. Die items zijn in de lijst gemarkeerd met een badge Apparaat.
- Aantal GPU's — hoeveel van die GPU u wilt gebruiken. Meer GPU's maken grotere modellen mogelijk via modelparallelisme.
Kwantisatie
Het precisieformaat voor de modelgewichten. Lagere precisie (bijvoorbeeld INT4) gebruikt minder VRAM maar kan de nauwkeurigheid verlagen; FP16/BF16 is volledige precisie.
Sequentielengte
De maximale contextlengte in tokens. Langere sequenties vragen meer VRAM voor de KV-cache — dit is meestal de instelling die een ruime pasvorm krap maakt.
Batchgrootte
Hoeveel verzoeken tegelijk worden verwerkt. Grotere batches verhogen de doorvoer maar vragen meer VRAM voor de KV-cache.
GPU-geheugenbenutting
Het percentage van het GPU-VRAM dat beschikbaar is voor het model. Reserveer 10–20% voor systeemoverhead en CUDA-bewerkingen.
Berekeningstype
| Optie | Wat het doet |
|---|---|
| 20% overhead | Eenvoudige schatting: gewichten plus een buffer van 20%. Snel en bewust behoudend. |
| Met activatie | Nauwkeuriger: neemt het activatiegeheugen mee dat tijdens inferentie werkelijk wordt gebruikt, berekend uit sequentielengte, batchgrootte, hidden size en intermediate size. |
Gebruik Met activatie wanneer de marge ertoe doet.
Resultaten
Samenvattingstegels
Bovenaan: Model, Kwantisatie, Batchgrootte, Vereist VRAM en Beschikbaar VRAM.
VRAM-verdeling
Een ringdiagram van waar het geheugen naartoe gaat.
Geheugendetails
| Onderdeel | Betekenis |
|---|---|
| Modelgewichten | Het geheugen dat de parameters van het model innemen bij de gekozen kwantisatie. |
| KV-cache | De key/value-cache, bepaald door sequentielengte en batchgrootte. |
| Overhead | De vaste buffer, in de modus 20% overhead. |
| Activeringen | Activatiegeheugen tijdens inferentie, in de modus Met activatie. |
| Vrij VRAM | Wat er overblijft. |
Benutting
Een balk die toont welk deel van het beschikbare VRAM de configuratie nodig heeft, en het oordeel:
- VRAM is voldoende — het past.
- VRAM is onvoldoende — het past niet. Verlaag de kwantisatie, verkort de sequentielengte, verklein de batchgrootte of voeg GPU's toe.
Houd in productie 20–30% VRAM vrij. Een configuratie die precies op 100% past, faalt zodra er een verzoek binnenkomt met een langere prompt dan waarmee u hebt getest.
Hoe dit zich verhoudt tot de startwizard
De wizard heeft zijn eigen, lichtere controle: de GPU-adviseur in het paneel Model, die schat op basis van alleen de gewichtsgrootte en zegt hoeveel GPU's een model nodig heeft. Gebruik die voor een snel oordeel tijdens het kiezen van een model.
Kom hier wanneer u het volledige plaatje nodig hebt — het effect van contextlengte en batchgrootte op de KV-cache, of een vergelijking tussen twee kwantisaties op hardware die u nog niet hebt.
Zie ook: Starthandleiding · AI-start
Typische toepassingen
- Vóór hardware-aankoop — probeer het model op GPU's die u niet hebt.
- Vóór een productie-uitrol — bevestig dat de contextlengte en batchgrootte die u wilt bedienen daadwerkelijk passen.
- Bij het kiezen van een kwantisatie — vergelijk BF16, FP8 en INT4 voor hetzelfde model op dezelfde kaart.
- Bij het plannen van meerdere GPU's — verhoog het aantal GPU's tot het model past en zie hoeveel ruimte er overblijft.