NVIDIA AI Dynamo
NVIDIA AI Dynamo is een gedistribueerde runtime voor grote taalmodellen: prefill (het lezen van de prompt) en decode (het schrijven van het antwoord) kunnen over afzonderlijke GPU's en workers worden verdeeld, waarbij een router bepaalt welke worker welk verzoek afhandelt.
In Cordatus gebruikt hij dezelfde startwizard als elke andere applicatie, met een rail die op zijn extra beslissingen is ingericht.
Starten
Stap 1 en 2 zijn hetzelfde als bij elke applicatie — zie de Starthandleiding:
- Apparaat selecteren
- Versie selecteren
- Geavanceerde configuratie, waar de rail specifiek voor Dynamo is.
De rail
| Sectie | Wat het bevat |
|---|---|
| Model | Het model dat wordt bediend, uit de modelhub, Gebruikersmodellen of een Aangepaste naam/URL. |
| Runtime | Geaggregeerd of gescheiden, en de router. |
| GPU-pijplijn | Welke GPU's elke worker krijgt. |
| Toegang | De chatinterface. |
| Overschrijvingen | Containeropties, omgevingsvariabelen, notebook. |
| Worker-argumenten | Engine-vlaggen, per workerklasse. |
| Controleren en starten | De opdracht van de frontend en elke container die wordt aangemaakt. |
De kaart Klaar om te starten onderaan de rail benoemt wat er nog ontbreekt — meestal "een worker heeft nog een GPU nodig".
Model
Drie bronnen, net als elders: Modelhub (Hugging Face, Ollama of NGC), Gebruikersmodellen (al op
dit apparaat) en Aangepast (een modelnaam of URL die u plakt, bijvoorbeeld
nemotron-mini:4b).
Runtime
Verwerkingsmodus
| Modus | Gedrag |
|---|---|
| Geaggregeerd | Eén worker doet zowel prefill als decode. Minder communicatie-overhead, het eenvoudigst te draaien. |
| Gescheiden | Prefill en decode draaien op aparte GPU's — flexibeler, ten koste van een KV-cache-overdracht ertussen. |
Router
Welke worker een verzoek krijgt:
| Router | Gedrag |
|---|---|
| kv | Routeert op KV-score — hergebruikt waar mogelijk gecachete prefixen. De standaard. |
| round-robin | Sequentieel en gebalanceerd. |
| random | Een willekeurige worker. |
KV-connector
Hoe de KV-cache wordt verplaatst of ontlast. De beschikbare opties hangen af van de modus:
- Geaggregeerd —
none,lmcache,kvbm - Prefill-workers (gescheiden) —
lmcache,kvbm,nixl,none - Decode-workers (gescheiden) —
nixl
lmcache en kvbm voegen optionele offload naar CPU-RAM of schijf toe; waar dat het geval is, toont
het paneel de cachegroottes als GB RAM, GB CPU-cache en GB schijfcache.
GPU-pijplijn
Een sleep-en-neerzetbord in plaats van een stapel keuzelijsten.
- Aan de ene kant Beschikbare GPU's, elk met benutting en vrij geheugen.
- Aan de andere kant de kolommen Prefill en Decode (in geaggregeerde modus één kolom Workers).
- Sleep een GPU op een worker om die toe te wijzen; Deze GPU vrijgeven zet hem terug.
- Prefill-worker toevoegen / Decode-worker toevoegen maken meer workers aan; Deze worker verwijderen haalt er een weg.
Het paneel is niet compleet zolang een worker geen GPU heeft ("Nog geen GPU — wijs er een toe uit Beschikbare GPU's"), en meldt wanneer alles is toegewezen ("Elke GPU is aan een worker toegewezen."). Ten minste één worker is vereist.
De ondertitel van elke worker toont de tensorparallelgrootte, TP=n.
Toegang
Eén schakelaar: Chatinterface — Open WebUI, gestart naast de Dynamo-frontend met een beheerdersaccount dat voor u wordt aangemaakt.
Staat hij uit, dan is het model bereikbaar op de eigen poort van de Dynamo-frontend.
Overschrijvingen
Dezelfde vier tabbladen als bij elke applicatie — Container, Omgeving, Engine-vlaggen en Notebook — met dezelfde slotmarkeringen op waarden die de applicatie vastlegt, en dezelfde actie Voorstel met AI die alle drie tegelijk invult en meldt wat er is aangepast om op uw hardware te passen.
Worker-argumenten
Engine-vlaggen, gesplitst naar de fase waarop ze van toepassing zijn:
- vlaggen voor elke worker (geaggregeerd), of
- vlaggen voor de fase die de prompt leest (prefill) en vlaggen voor de fase die het antwoord schrijft (decode).
Publiceert de image er geen, dan meldt het paneel dat in plaats van een lege editor te tonen.
Controleren en starten
Dynamo maakt meerdere containers aan, dus het controlepaneel vermeldt welke opdracht het toont: die van de frontend, met de overige containers eronder bij Aan te maken containers. Blokkades staan bovenaan en elke blokkade springt naar het paneel dat die oplost.
Na de start
Elke Dynamo-container verschijnt als één containergroep op de pagina Containers. Open de groep om bij de logs, parameters en poorten van elke worker afzonderlijk te komen.
De container die u aanroept is de frontend. Zijn tabblad Poorten geeft u het lokale adres en laat u een openbare URL genereren.