Ga naar hoofdinhoud

Snelstart

Krijg in ongeveer 10 minuten een model draaiend op uw eigen hardware. Deze pagina is de korte versie; elke sectie linkt naar de volledige handleiding.

Kies een model, laat AI-start het plannen, start het en chat ermee in de interface die het maakte

 


Vereisten

  • Een Cordatus-account met de containerrechten
  • Ten minste één apparaat dat met Cordatus is verbonden en Online staat
  • Een GPU op dat apparaat (aanbevolen voor LLM-applicaties)
  • De Cordatus Client geïnstalleerd en draaiend
tip

Nog geen apparaat? Doe eerst de snelstart van Device Hub — niets in LLM Launcher werkt zonder.


De snelste route: AI-start (ongeveer 4 minuten)

Wilt u alleen een draaiend model, sla de wizard dan helemaal over.

  1. Ga naar LLM Launcher → LLM-modellen.
  2. Zoek een klein model — Qwen/Qwen3-8B is een goede eerste keuze.
  3. Klik op AI-start op die rij.
  4. Volg de zes planningsfasen. Zodra er Plan gereed staat, leest u de samenvattingsregel: Klaar om te starten op {device}.
  5. Open Details als u de gekozen engine, image, GPU's, kwantisatie en context wilt zien, en Waarom deze instellingen voor de onderbouwing.
  6. Zet Chatinterface aan onder het plan en kopieer de inloggegevens die worden getoond.
  7. Klik op Starten.

Dat is alles. Ga verder bij Controleer uw uitrol.

AI-start


De volledige route: de startwizard (ongeveer 10 minuten)

1. Blader door de applicaties (1 minuut)

LLM Launcher → Applicaties. Filter op apparaattype — Server - werkstation, Jetson of DGX Spark — en kies een engine:

  • vLLM — LLM-inferentie met hoge doorvoer
  • TensorRT-LLM — de geoptimaliseerde engine van NVIDIA
  • Ollama — eenvoudige lokale modellen
  • llama.cpp — GGUF-gewichten, ook op Jetson
  • NVIDIA Dynamo — gedistribueerd over meerdere GPU's
  • NVIDIA VSS — videozoeken en samenvatten

Open er een met Details bekijken en bekijk het tabblad Versies.

Starthandleiding

2. Start de wizard (1 minuut)

Klik op Toepassing op één apparaat starten.

Stap 1 — Apparaat selecteren. Kies een verbonden apparaat. De voettekst bevestigt Uitrollen naar {device}.

Stap 2 — Versie selecteren. Alleen compatibele images worden getoond. Elk is gemarkeerd als:

  • Gedownload — staat al op het apparaat
  • Wordt gedownload — wordt bij de start opgehaald
  • Niet compatibel — met de reden, bijvoorbeeld een niet-overeenkomende stuurprogrammaversie

Klik op Volgende.

3. Configureer (4 minuten)

Stap 3 is een rail. Werk hem van boven naar beneden af.

Profiel (bovenaan het scherm) — klik op Snelle start. Dat zet de chatinterface aan en raakt verder niets aan.

Model

  1. Blijf op de kaart Modelhub.
  2. Kies een klein model — 7B of 8B voor een eerste uitrol.
  3. Lees de regel onder de catalogus. U wilt zien: "{model} past ruim binnen uw selectie."

Rekenkracht

  1. Selecteer een GPU of zet Alles gebruiken aan.
  2. Laat Hostlimieten op Automatisch staan.

Toegang — al ingesteld door het profiel Snelle start. Kopieer de inloggegevens die worden getoond; ze verschijnen eenmalig.

Overschrijvingen — sla over. De standaardwaarden van de applicatie kloppen al.

Controleren en starten — lees de Resulterende opdracht en de Aan te maken containers. Staat er een blokkade, klik erop: die brengt u naar het paneel dat het oplost.

Starthandleiding

4. Starten (1 minuut, plus het ophalen van de image)

Klik op Omgeving starten.

Achter de schermen maakt Cordatus verbinding met het apparaat, haalt de image op als die er niet is, maakt de containers aan, configureert netwerk en volumes, en start de serveerlaag ernaast.

Een eerste keer ophalen kan enkele minuten duren. De container toont ondertussen Downloaden.


Controleer uw uitrol

  1. Ga naar LLM Launcher → Containers.
  2. Zoek de nieuwe containergroep en controleer de status.
  3. Open de groep en klik daarna op Containerinformatie bij de engine.
  4. Logs — u zou het model moeten zien laden.
  5. Poorten — kopieer het lokale adres.

Test het:

curl http://<apparaat-ip>:<poort>/v1/models

Open daarna het adres van de Open WebUI-container in een browser en log in met de beheerdersgegevens die u hebt gekopieerd.

Containers


Verwacht resultaat

  • De engine-container draait, met logberichten over het laden van het model
  • De Open WebUI-container draait en u kunt met het model chatten
  • Beide verschijnen als één groep onder Containers
  • Hebt u ook de gateway aangezet, dan draait er een LiteLLM-container (plus PostgreSQL, Redis en Prometheus) en is het model daarin geregistreerd

Wat nu

Controleer of een model past voordat u het uitrolt (5 minuten)

LLM Launcher → VRAM-calculator:

  1. Zoek een groter model, bijvoorbeeld Llama-2-70B.
  2. Kies een GPU — of GPU's van het apparaat selecteren om uw echte hardware te gebruiken.
  3. Stel de sequentielengte en batchgrootte in die u werkelijk wilt bedienen.
  4. Zet Berekeningstype op Met activatie.
  5. Vergelijk kwantisaties tot er VRAM is voldoende staat.

VRAM-calculator

Gebruik modellen die al op uw apparaat staan (10 minuten)

  1. Apparaten → uw apparaat → Modellen → Opslagpaden — registreer de HuggingFace-, Ollama- en NIM-paden.
  2. LLM-modellen → Gebruikersmodellen → Modellen op uw apparaten verkennen — kies het apparaat, Beginnen met scannen, kies doel-engines, {n} model(len) toevoegen.
  3. Klik op AI-start bij een van die modellen — het plan wordt gemaakt voor het apparaat waarop het staat, en er wordt niets gedownload.

Gebruikersmodellen

Download een model naar een apparaat (5 minuten)

LLM-modellen → Downloaden op een willekeurige rij: kies het apparaat, de geregistreerde map en de kwantisatie, voeg een token toe als de repository is afgeschermd, en laat het apparaat het ophalen.

LLM-modellen

Bied het netjes aan (10 minuten)

LLM Launcher → Serveerlaag: rol een LiteLLM-gateway uit, registreer uw draaiende model erin en geef beperkte virtual keys uit aan uw clients in plaats van de master key uit te delen.

Serveerlaag

Ga verder (15–30 minuten)

  • NVIDIA AI Dynamo — geaggregeerd versus gescheiden, routers, KV-connectors en een sleep-en-neerzet GPU-pijplijn. → NVIDIA AI Dynamo
  • NVIDIA VSS — een videopijplijn met vijf services waarbij elke service nieuw, bestaand of extern kan zijn. → NVIDIA VSS
  • Sparkrun — inferentie over meerdere nodes op een DGX Spark-cluster. → Sparkrun-clusters
  • Jetson AI Lab — de catalogus van NVIDIA, in één stap gestart op een Jetson. → Jetson AI Lab

Beheer wat u hebt (5 minuten)

Start en stop containers afzonderlijk of per groep, dupliceer er een om een variant te proberen, genereer openbare URL's, lees de voorbeelden van API-gebruik en verwijder wat u niet meer nodig hebt.

Containers


Problemen oplossen

De startknop is uitgeschakeld Open Controleren en starten. Elke blokkade staat daar, en elke blokkade is een knop die naar het paneel springt dat het oplost. De meest voorkomende zijn "geen GPU geselecteerd" en "geen model geselecteerd".

De container start niet

  • Staat het apparaat nog Online?
  • Is er schijfruimte voor de image?
  • Lees het tabblad Logs van de container — de fout staat er bijna altijd.

Onvoldoende VRAM

  • Controleer het in de VRAM-calculator met Met activatie.
  • Verlaag de kwantisatie (BF16 → FP8 → INT4), verkort de sequentielengte, verklein de batchgrootte of voeg GPU's toe.
  • De GPU-adviseur van de wizard waarschuwt hiervoor al vóór de start: "past, maar net" betekent dat er weinig ruimte overblijft voor de KV-cache.

Model niet gevonden

  • Aangepast model: controleer de repository-id precies zoals die op huggingface.co staat.
  • Gebruikersmodellen: controleer of de modelpaden ook op het doelapparaat zijn geregistreerd.
  • Controleer de volumekoppeling op het tabblad Container bij de overschrijvingen.

Afgeschermd model / 401 De rij in LLM-modellen zegt of er een token nodig is. Voeg er een toe uit uw kluis, of plak er een op het tabblad Omgeving bij de overschrijvingen.

Open WebUI toont geen modellen

  • Draait de engine-container werkelijk?
  • Is hij op een gateway gericht: is het model in de gateway geregistreerd? Controleer Serveerlaag → Bedient.

AI-start zegt "De bestanden van het model konden niet op het apparaat worden gelezen" Het geregistreerde modelpad op dat apparaat is onleesbaar. Herstel het pad; het plan is teruggevallen op Hugging Face en zou de gewichten anders opnieuw downloaden.


Snelle referentie

Applicatietypen

TypeToepassingComplexiteitInstallatietijd
AI-startElk Hugging Face-model, voor u geplandLaagst2 min
StandaardapplicatiesBasiscontainersLaag5 min
LLM-enginesModelinferentie met volledige controleGemiddeld5 min
NVIDIA DynamoGedistribueerd over meerdere GPU'sHoog10 min
NVIDIA VSSVideo-analysepijplijnHoog15 min
SparkrunDGX Spark over meerdere nodesHoog20 min (plus clusterinstallatie)

Ruwe richtlijn voor GPU-geheugen

ModelgrootteKwantisatieMinimaal VRAMTypische GPU
7–8BINT44–6 GBRTX 3090, RTX 4090
7–8BINT88–10 GBRTX 4090, A10
13BINT48–10 GBRTX 4090, A10
13BINT814–16 GBA10, A100 40GB
70BINT440–50 GBA100 80GB, 2× A100 40GB
70BINT880–90 GBA100 80GB, 2× A100 80GB

Dit zijn alleen de gewichten. Tel de KV-cache erbij op voor de contextlengte en batchgrootte die u wilt bedienen — daar is de VRAM-calculator voor.

Waar u wat vindt

Ik wil…Ga naar
Applicaties bekijken en startenLLM Launcher → Applicaties
Zien wat er draaitLLM Launcher → Containers
Een model zoeken of downloadenLLM Launcher → LLM-modellen
Een model gebruiken dat al op een apparaat staatLLM-modellen → Gebruikersmodellen
Een gateway of chatinterface zelfstandig draaienLLM Launcher → Serveerlaag
Inferentie over meerdere nodes opzettenLLM Launcher → Sparkrun-clusters
Een Jetson AI Lab-model draaienLLM Launcher → Jetson AI Lab
Controleren of een model pastLLM Launcher → VRAM-calculator
Uw eigen image pushenLLM Launcher → Privéregistry
Modelpaden registrerenApparaten → apparaat → Modellen

Hulp