Ga naar hoofdinhoud

Starthandleiding

Deze handleiding behandelt de volledige startwizard: de route die u neemt wanneer u de image, de GPU's, de vlaggen en de serveerlaag zelf wilt kiezen. Laat u de keuze liever aan Cordatus, gebruik dan AI-start — en houd er rekening mee dat u vanuit een AI-startplan altijd met Bewerken in Geavanceerd naar deze wizard kunt overstappen.

Van de applicatiecatalogus naar een draaiende engine, gateway en chatinterface

 


1. Zoek de applicatie

LLM Launcher → Applicaties toont elke kant-en-klare applicatie. De pagina biedt:

  • Zoeken in de subkop.
  • Filteren op apparaattypeServer - werkstation, Jetson, DGX Spark.
  • Voor Jetson een extra filter Selecteer Jetson-groep…, zodat u alleen ziet wat uw eigen Jetson-groepen kunnen draaien.
  • Actieve filterchips onder de kop, elk verwijderbaar, plus Alles wissen.
  • Kaarten met de applicatienaam, het logo van de uitgever, een korte beschrijving en maximaal drie tags (de rest achter +{n} more). Op een tag klikken filtert erop.
  • Meer applicaties laden, of oneindig scrollen naarmate u de onderkant nadert.

Klik op een kaart, of op Details bekijken onderaan, om de applicatie te openen.

Zoeken en daarna filteren op tag — de chips tonen wat actief is

 


2. De detailpagina van de applicatie

De kop toont de naam, het typelabel, de beschrijving, de tags en twee compatibiliteitsbadges: Server-werkstation (x86_64) en Jetson (arm64), groen bij ondersteuning en rood zonder.

Rechts staan twee acties:

  • Toepassing op één apparaat starten (of Omgeving op één apparaat starten) — de wizard die hieronder wordt beschreven.
  • Sparkrun starten — alleen bij engines die dat ondersteunen, voor uitvoeringen over meerdere DGX Spark-nodes. Zie Sparkrun-clusters.

Vier tabbladen:

README / beschrijving

De README van de applicatie, met een zijbalk die bevat:

  • In één oogopslag — categorie, nieuwste release, aantal versies.
  • Apparaatcompatibiliteit — dezelfde twee badges, met de architectuur ernaast.
  • Geschikte apparaten — elk apparaat van u dat hem kan draaien, met een online/offline-stip en een knop Starten eronder.

Versies

Een sorteerbare, gepagineerde tabel van elke image-versie:

KolomBetekenis
TagDe image-tag.
GrootteOngecomprimeerde grootte, wanneer de versie één variant heeft.
AangemaaktPublicatiedatum.
Vereiste versie(s)De minimale NVIDIA-stuurprogrammaversie, of een badge Jetpacks ({n} Version(s)) die u kunt aanwijzen om ze op te sommen.
ApparatenServer - werkstation, of Jetson ({n} Group(s)) — wijs aan om te zien welke groepen.

Versies met meerdere hardwarevarianten worden samengevouwen tot één rij met een uitklappijl; die openen toont elke variant met eigen grootte, datum, stuurprogramma-eis en apparaatlijst.

Kolommen aanpassen (het icoon naast het zoekveld) laat u deze kolommen tonen, verbergen en slepend herordenen. Uw keuze wordt onthouden.

Containers

Alles wat u al vanuit deze applicatie hebt gestart, in dezelfde indeling met twee tabbladen als de hoofdpagina Containers: Containers en Sparkrun-workloads.

Modellen

Alleen voor engine-applicaties: de modelcatalogus, gefilterd op modellen die deze engine kan bedienen, met een knop Uitrollen die u rechtstreeks in de wizard zet met het model al geselecteerd.


3. Stap 1 — Apparaat selecteren

De wizard opent als een accordeon met drie stappen. De kop van elke stap blijft tonen wat u hebt gekozen, zodat de beslissingen boven de geopende stap leesbaar blijven.

Kies het apparaat waarop u wilt uitrollen. Alleen verbonden apparaten kunnen worden geselecteerd; de voettekst bevestigt Uitrollen naar apparaat.

Volgende blijft uitgeschakeld tot er een verbonden apparaat is gekozen.


4. Stap 2 — Versie selecteren

De versielijst is gefilterd op wat uw geselecteerde apparaat werkelijk kan draaien. Compatibiliteit wordt streng gecontroleerd: een image die voor een nieuwere JetPack is gebouwd, wordt nooit aan een ouder apparaat aangeboden.

Elke versie toont:

  • Gedownload — staat al op het apparaat, dus starten gaat direct.
  • Wordt gedownload — wordt bij de start naar het apparaat gehaald.
  • Niet compatibel — met de reden, bijvoorbeeld "Stuurprogrammaversie komt niet overeen — uw apparaat: X, vereist: Y".

U hebt ook een zoekveld, een besturingselement Filteren op image-eigenschappen en een herlaadknop.

Komt er niets overeen, dan meldt de lijst "Geen compatibele versies gevonden voor uw apparaat" in plaats van images te tonen die zouden falen.

notitie

Bij starten vanuit de Privéregistry is er geen versiestap — de tag waarvan u vertrekt, is de versie. De wizard gaat direct van apparaat naar geavanceerde configuratie.


5. Stap 3 — Geavanceerde configuratie

Hier is het herontwerp het duidelijkst zichtbaar. In plaats van een lange rij panelen is de stap een verticale rail: één item per beslissing, elk met een eigen ondertitel die het huidige antwoord samenvat en een markering die aangeeft of het rond is.

Installatie
● Model Qwen/Qwen3-8B ✓
● Rekenkracht GPU's · geheugen · CPU ✓
● Toegang chatinterface · gateway ✓
● Overschrijvingen 3 opties · notebook aan ✎
● Controleren/starten opdracht · containers ›

Klaar om te starten
✓ GPU geselecteerd
✓ Model geselecteerd
✓ Configuratie geldig

De kaart Klaar om te starten is vastgezet onderaan de rail, naast de knop die hij bewaakt. Ontbreekt er iets, dan wordt dat benoemd.

Profielen

Boven de rail staan vier voorinstellingen:

ProfielEffect
Snelle startAlleen de chatinterface.
Een API aanbiedenGateway + chatinterface.
Alleen gatewayGateway en sleutels, geen chatinterface.
Alleen engineGeen extra dienst.

Een profiel vult alleen de sectie Toegang in. Het raakt uw model-, GPU- of overschrijvingskeuzes nooit aan.


5.1 Model

Het eerste paneel, voor engine-applicaties. Twee bronkaarten:

  • Modelhub — de catalogus (Hugging Face / Ollama / NVIDIA NIM, afhankelijk van de engine).
  • Gebruikersmodellen — modellen die al op dit apparaat staan. Zie Gebruikersmodellen.
  • Aangepast — een naam of URL die u zelf plakt.

De GPU-adviseur

Eén regel boven de catalogus, die het geselecteerde model afzet tegen de GPU's van het apparaat:

  • "Kies eerst een model — dit paneel zegt dan hoeveel GPU's het nodig heeft."
  • "{model} past ruim binnen uw selectie."
  • "{model} past, maar net." — er blijft weinig ruimte voor de KV-cache, dus een lange context of veel gelijktijdige verzoeken kunnen mislukken.
  • "Uw selectie is niet genoeg — {model} heeft minstens {n} GPU's nodig."
  • "{model} past niet op dit apparaat." — alleen de gewichten al vullen alle GPU's samen.

Hij waarschuwt ook wanneer de GPU's van het apparaat verschillende hoeveelheden VRAM rapporteren, omdat tensorparallelisme gelijkmatig verdeelt en de kleinste kaart bepaalt wat er past.

notitie

De schatting is alleen gemaakt op basis van de gewichtsgrootte. De contextlengte die u kiest, moet er nog naast passen — gebruik de VRAM-calculator wanneer de marge ertoe doet.

De catalogus

Elke rij toont de tag, Kwantisatie, Grootte en een badge:

  • Op het apparaat — de gewichten staan er al.
  • Wordt gedownload — ze worden bij de start opgehaald.
  • Aanpassen aan selectie — het past op de GPU's die u hebt geselecteerd.

U kunt zoeken, sorteren en wisselen tussen de passende modellen en Alle modellen. Kiest u een model met meerdere kwantisaties, dan klapt de rij open zodat u de kwantisatie kunt kiezen die u wilt starten.

Modeloverdracht

Kiest u uit Gebruikersmodellen een model dat op een ander apparaat staat, dan biedt Cordatus aan het over te zetten:

  • Modeloverdracht vereist — normale situatie; toont de modelgrootte en het bronpad.
  • Modeloverdracht hervatten — een eerdere poging was onvolledig; toont hoeveel er al staat en hoeveel bestanden ontbreken of half zijn.
  • Beschadigde bestanden gevonden — de checksumcontrole is mislukt en de betrokken bestanden worden opnieuw gedownload.

De voortgang is per bestand, met totale bytes en bestandsaantallen. Alleen API gebruiken slaat de overdracht over wanneer het model in plaats daarvan via een API bereikbaar is.


5.2 Rekenkracht

GPU's

Elke GPU op het apparaat als kaart, met VRAM VRIJ, BENUTTING en TEMP. Selecteer afzonderlijke GPU's of zet Alles gebruiken aan. Er moet ten minste één GPU zijn geselecteerd voordat starten is toegestaan.

Hostlimieten

CPU- en geheugenlimieten voor de container:

  • Automatisch — de standaard. Laat de host vrij om ander werk in te plannen: de container wordt begrensd op het bruikbare deel, waarbij de Host Reserved CPU en RAM voor het systeem worden achtergehouden.
  • Aangepast — stel de CPU-limiet en de Geheugenlimiet met de hand in, tussen het getoonde minimum en het bruikbare maximum.
  • Een limiet volledig uitzetten kan ook, en wordt op de kaart benoemd: "Geen CPU-limiet — de container mag alle {n} cores gebruiken."
tip

Behoud de Host Reserved-waarden tenzij u een reden hebt om dat niet te doen. Zij voorkomen dat een zware engine de eigen agent van het apparaat uithongert.


5.3 Toegang

Alleen aanwezig wanneer de applicatie een serveerlaag ondersteunt. Twee kaarten, elk een schakelaar:

  • Chatinterface — Open WebUI, met een beheerdersaccount dat voor u wordt aangemaakt.
  • API-gateway — LiteLLM: één OpenAI-compatibel endpoint met sleutels, quota's en verzoeklogs.

Staan ze beide uit, dan wordt alleen de eigen poort van de engine gepubliceerd.

Welke gateway?

Draait er op het apparaat al een LiteLLM-gateway, dan vindt Cordatus die en biedt aan hem te hergebruiken — het model wordt erin geregistreerd en er zijn geen nieuwe inloggegevens nodig. U kunt nog steeds kiezen voor Deploy in plaats daarvan een nieuwe gateway, die zijn eigen PostgreSQL-, Redis- en Prometheus-containers opstart en bij de eerste keer opstarten databasemigraties uitvoert (enkele minuten).

Bijzondere gevallen die de kiezer eerlijk meldt:

  • er draait meer dan één gateway → u kiest in welke het model wordt geregistreerd;
  • een gateway waarvan de master key niet in de omgeving staat → Cordatus kan er niets in registreren, dus wordt er een nieuwe uitgerold;
  • het apparaat kon niet worden bevraagd → er wordt een nieuwe uitgerold als er geen draait.

Inloggegevens

Eén kaart met elk geheim dat deze uitrol uitdeelt — het Open WebUI-beheerdersadres en -wachtwoord, de LiteLLM master key, de modelnaam die clients sturen — elk met Weergeven, Kopiëren en een actie Alles opnieuw genereren.

waarschuwing

Deze worden eenmalig getoond, direct nadat de omgeving is gestart. Cordatus slaat ze niet op. De adressen verschijnen daarna op het tabblad Poorten van elke container.

Accounts en sleutels

  • Open WebUI-accounts — extra accounts die worden aangemaakt zodra Open WebUI is opgestart, zodat mensen met hun eigen e-mailadres inloggen in plaats van het beheerdersaccount te delen.
  • LiteLLM virtual keys — aangemaakt op de gateway zodra die draait, elk met een naam, een optioneel budget en een optioneel bereik alleen dit model. Deel deze uit in plaats van de master key.

Geavanceerde toegangsopties

Standaard ingeklapt:

  • Modelnaam die clients versturen — de publieke alias. Die apart houden van de echte gewichten laat u ze later verwisselen zonder clients te breken.
  • Imageversies voor LiteLLM en Open WebUI — eerst vastgezette releases, dan pre-releases, dan bewegende tags zoals rc, dev en main-stable, waarvan de inhoud onder u verandert.
  • Open WebUI verbinden met — de LiteLLM-gateway (zodat hij elk model ziet dat de gateway bedient) of rechtstreeks de Engine.
  • Een openbare URL aanmaken voor Open WebUI en/of voor de gateway.

5.4 Overschrijvingen

Eén kaart met vier tabbladen, elk met een live teller:

TabbladWat het bevat
Containerdocker run-opties — poorten, volumes, netwerk, herstartbeleid, apparaten.
OmgevingOmgevingsvariabelen, inclusief tokens uit uw kluis.
Engine-vlaggenEngine-specifieke argumenten voor deze image.
NotebookJupyter-instellingen, wanneer de image die ondersteunt.

Een legenda geeft aan welke regels u mag wijzigen: ✎ u kunt bewerken versus 🔒 vastgelegd door de applicatie. Wat de applicatie vastlegt, kan niet worden verwijderd.

Poorten en volumes

Poorten tonen wat er vrij is op de host en waarschuwen wanneer er een al in gebruik is. Volumes kiest u met een hostmapverkenner die het echte bestandssysteem van het apparaat leest.

pas op

Hostmappen worden ongewijzigd aan de container blootgesteld. Zorg dat u weet wat u koppelt.

Tokens

Omgevingsvariabelen kunnen hun waarde uit uw tokenkluis halen — Kies een token, of voeg ter plekke Een nieuw token toe, dat wordt opgeslagen en herbruikbaar is in andere omgevingen. Afgeschermde Llama-repositories zijn de gebruikelijke reden om er een nodig te hebben.

Voorstel met AI

Voorstel met AI vult de tabbladen Container, Omgeving en Engine-vlaggen tegelijk in vanuit een resolver die het model afzet tegen de geselecteerde hardware. Zijn rapport verschijnt boven de tabbladen, niet binnen één ervan, omdat hij alle drie herschrijft:

  • "Het model past niet op de geselecteerde hardware."
  • "Aanpassingen toegepast om op uw hardware te passen:" gevolgd door elke aanpassing.
  • "Afgeleid van {basismodel}" wanneer de configuratie van een verwant model is afgeleid.
  • Inzichten — hardwaresuggesties en kwalitatieve waarnemingen, in één lijst.

Er nogmaals op drukken zet hem uit en herstelt de statische standaardwaarden.

Notebook

Waar beschikbaar draait Jupyter in dezelfde container, dus notebooks delen het model, de gekoppelde mappen en de GPU's. De beveiliging is ofwel een Toegangstoken (voor u gegenereerd, eenmaal per browser gevraagd) of een Wachtwoord.

pas op

Een onbeveiligd notebook geeft iedereen die de host op die poort kan bereiken een notebook met shell-toegang. Gebruik dit alleen op een geïsoleerd netwerk.


5.5 Controleren en starten

Het laatste paneel voordat er iets draait:

  • Samenvatting — elke beslissing als een regel met label en waarde, elk met een potlood dat terugspringt naar het paneel dat erover gaat. Wat niet is ingesteld, leest als niet ingesteld.
  • Resulterende opdracht — de daadwerkelijke opdracht, samengesteld uit dezelfde opties, variabelen en argumenten die naar het apparaat gaan. Kopiëren zet hem op uw klembord.
  • Aan te maken containers — de volledige lijst, inclusief wat de serveerlaag meebrengt.
  • Blokkades — ontbreekt er iets, dan staat dat bovenaan, en elk item is een knop die u naar het paneel brengt dat het oplost.

6. Starten

De voettekst draagt het oordeel naast de knop die hij bewaakt: het apparaat waarop u uitrolt, een gereedheidslabel en:

KnopWanneer
Terug / VolgendeWisselen tussen de drie stappen.
Controleren en startenBrengt u op de rail-route naar het controlepaneel.
Omgeving startenStart de uitrol. Uitgeschakeld zolang er een blokkade is.
AnnulerenSluit de wizard.

Na de start:

  1. Cordatus autoriseert de bewerking op het apparaat.
  2. Is de image niet aanwezig, dan wordt hij opgehaald — zichtbaar als de status Downloaden van de container.
  3. De containers verschijnen gegroepeerd op de pagina Containers.
  4. Is er een serveerlaag geconfigureerd, dan verschijnt het dialoogvenster Sla de inloggegevens van uw serveerlaag op. Kopieer ze; ze worden eenmalig getoond.

Applicaties met meerdere componenten

Twee applicaties gebruiken dezelfde rail met een andere set panelen:

  • NVIDIA AI Dynamo — Model, Runtime, GPU-pijplijn, Toegang, Overschrijvingen, Worker-argumenten, Controleren. → NVIDIA AI Dynamo
  • NVIDIA VSS — één genummerd railitem per service in de pijplijn, daarna Controleren. → NVIDIA VSS

Applicaties op basis van Docker Compose krijgen in plaats daarvan een indeling met Compose-services / Compose-profielen / Configuratievariabelen; services in de geselecteerde profielen starten met de omgeving mee, en de primaire service draait altijd.