Ga naar hoofdinhoud

NVIDIA AI Dynamo

NVIDIA AI Dynamo is een gedistribueerde runtime voor grote taalmodellen: prefill (het lezen van de prompt) en decode (het schrijven van het antwoord) kunnen over afzonderlijke GPU's en workers worden verdeeld, waarbij een router bepaalt welke worker welk verzoek afhandelt.

In Cordatus gebruikt hij dezelfde startwizard als elke andere applicatie, met een rail die op zijn extra beslissingen is ingericht.

Een geaggregeerde Dynamo-run: runtime, router, GPU-pijplijn, worker-argumenten en de tien containers die eruit ontstaan

 


Starten

Stap 1 en 2 zijn hetzelfde als bij elke applicatie — zie de Starthandleiding:

  1. Apparaat selecteren
  2. Versie selecteren
  3. Geavanceerde configuratie, waar de rail specifiek voor Dynamo is.

De rail

SectieWat het bevat
ModelHet model dat wordt bediend, uit de modelhub, Gebruikersmodellen of een Aangepaste naam/URL.
RuntimeGeaggregeerd of gescheiden, en de router.
GPU-pijplijnWelke GPU's elke worker krijgt.
ToegangDe chatinterface.
OverschrijvingenContaineropties, omgevingsvariabelen, notebook.
Worker-argumentenEngine-vlaggen, per workerklasse.
Controleren en startenDe opdracht van de frontend en elke container die wordt aangemaakt.

De kaart Klaar om te starten onderaan de rail benoemt wat er nog ontbreekt — meestal "een worker heeft nog een GPU nodig".


Model

Drie bronnen, net als elders: Modelhub (Hugging Face, Ollama of NGC), Gebruikersmodellen (al op dit apparaat) en Aangepast (een modelnaam of URL die u plakt, bijvoorbeeld nemotron-mini:4b).


Runtime

Verwerkingsmodus

ModusGedrag
GeaggregeerdEén worker doet zowel prefill als decode. Minder communicatie-overhead, het eenvoudigst te draaien.
GescheidenPrefill en decode draaien op aparte GPU's — flexibeler, ten koste van een KV-cache-overdracht ertussen.

Router

Welke worker een verzoek krijgt:

RouterGedrag
kvRouteert op KV-score — hergebruikt waar mogelijk gecachete prefixen. De standaard.
round-robinSequentieel en gebalanceerd.
randomEen willekeurige worker.

KV-connector

Hoe de KV-cache wordt verplaatst of ontlast. De beschikbare opties hangen af van de modus:

  • Geaggregeerdnone, lmcache, kvbm
  • Prefill-workers (gescheiden) — lmcache, kvbm, nixl, none
  • Decode-workers (gescheiden) — nixl

lmcache en kvbm voegen optionele offload naar CPU-RAM of schijf toe; waar dat het geval is, toont het paneel de cachegroottes als GB RAM, GB CPU-cache en GB schijfcache.


GPU-pijplijn

Een sleep-en-neerzetbord in plaats van een stapel keuzelijsten.

  • Aan de ene kant Beschikbare GPU's, elk met benutting en vrij geheugen.
  • Aan de andere kant de kolommen Prefill en Decode (in geaggregeerde modus één kolom Workers).
  • Sleep een GPU op een worker om die toe te wijzen; Deze GPU vrijgeven zet hem terug.
  • Prefill-worker toevoegen / Decode-worker toevoegen maken meer workers aan; Deze worker verwijderen haalt er een weg.

Het paneel is niet compleet zolang een worker geen GPU heeft ("Nog geen GPU — wijs er een toe uit Beschikbare GPU's"), en meldt wanneer alles is toegewezen ("Elke GPU is aan een worker toegewezen."). Ten minste één worker is vereist.

De ondertitel van elke worker toont de tensorparallelgrootte, TP=n.


Toegang

Eén schakelaar: Chatinterface — Open WebUI, gestart naast de Dynamo-frontend met een beheerdersaccount dat voor u wordt aangemaakt.

Staat hij uit, dan is het model bereikbaar op de eigen poort van de Dynamo-frontend.


Overschrijvingen

Dezelfde vier tabbladen als bij elke applicatie — Container, Omgeving, Engine-vlaggen en Notebook — met dezelfde slotmarkeringen op waarden die de applicatie vastlegt, en dezelfde actie Voorstel met AI die alle drie tegelijk invult en meldt wat er is aangepast om op uw hardware te passen.


Worker-argumenten

Engine-vlaggen, gesplitst naar de fase waarop ze van toepassing zijn:

  • vlaggen voor elke worker (geaggregeerd), of
  • vlaggen voor de fase die de prompt leest (prefill) en vlaggen voor de fase die het antwoord schrijft (decode).

Publiceert de image er geen, dan meldt het paneel dat in plaats van een lege editor te tonen.


Controleren en starten

Dynamo maakt meerdere containers aan, dus het controlepaneel vermeldt welke opdracht het toont: die van de frontend, met de overige containers eronder bij Aan te maken containers. Blokkades staan bovenaan en elke blokkade springt naar het paneel dat die oplost.


Na de start

Elke Dynamo-container verschijnt als één containergroep op de pagina Containers. Open de groep om bij de logs, parameters en poorten van elke worker afzonderlijk te komen.

tip

De container die u aanroept is de frontend. Zijn tabblad Poorten geeft u het lokale adres en laat u een openbare URL genereren.