Ga naar hoofdinhoud

AI-start

AI-start is de weg naar een draaiend model in één dialoogvenster. U geeft een Hugging Face-repository-id op — of u drukt op AI-start op een rij in de modellijst, waarmee die alvast wordt ingevuld — en Cordatus regelt de rest: welk van uw apparaten het model kan draaien, welke engine, welke container-image, hoeveel GPU's, welke kwantisatie, welke context en welke vlaggen.

Er wordt niets gestart voordat u het plan hebt gezien.

De zes planningsfasen, Details, Waarom deze instellingen, het docker-commando en dan Starten

 


Waar u het start

StartpuntWat er gebeurt
LLM-modellen → Hugging Face, de knop AI-start op een modelrijHet model is al gekozen; het dialoogvenster hoeft alleen een apparaat te kiezen en te plannen.
LLM-modellen → Gebruikersmodellen, de knop AI-start op een modelrijHet model en het apparaat zijn al bekend — het plan wordt gemaakt voor het apparaat waarop het model staat.
Geopend zonder modelHet dialoogvenster vraagt eerst om een Hugging Face-model-id (bijvoorbeeld Qwen/Qwen3-8B). Druk op Enter om te beginnen.

Naast AI-start staat altijd HandmatigHandmatig uitvoeren met…, dat u in plaats daarvan naar de startwizard brengt.


1. Afgeschermde modellen en tokens

Als de modellijst al weet dat de repository afgeschermd (gated) is, vraagt het dialoogvenster vóór het plannen om een Hugging Face-token — een afgeschermd model heeft er een nodig om zowel de configuratie te lezen als de gewichten te downloaden, dus vooraf vragen bespaart een zeker mislukte ronde.

U kunt:

  • Een opgeslagen token gebruiken uit uw tokenkluis, of
  • er een plakken in het veld eronder (hf_…).
notitie

Dit veld is een API-token, geen inlogwachtwoord. Cordatus voorkomt bewust dat de wachtwoordmanager van de browser het automatisch invult.


2. Plannen

Plannen bestaat uit zes fasen, en het dialoogvenster toont in welke fase het zit in plaats van één draaiend icoontje:

  1. Uw apparaten controleren — welke apparaten online zijn en wat ze rapporteren.
  2. Het model lezenconfig.json en de bestandslijst van de repository. Staat het model al op het apparaat, dan wordt dit van het apparaat zelf gelezen in plaats van van Hugging Face.
  3. Een inferentie-engine kiezen
  4. Een container-image zoeken
  5. GPU's en context toewijzen
  6. Engine-argumenten afstemmen

Als het klaar is, staat er Plan gereed.

pas op

Heeft Cordatus een modelpad geregistreerd voor het apparaat maar kan het de bestanden daar niet lezen, dan verschijnt boven het resultaat een waarschuwing: "De bestanden van het model konden niet op het apparaat worden gelezen … Het plan is teruggevallen op Hugging Face." Dat is de oorzaak van een download die daarop volgt — herstel het pad, niet de repository-id of het token.


3. Het doelapparaat kiezen

Onder het invoerveld toont Cordatus de apparaten die dit model kunnen draaien, gerangschikt, met het gekozen apparaat geselecteerd:

  • \{n\} of \{m\} device(s) can run this model
  • Apparaten die niet zijn meegenomen, staan achter Toon {n} apparaat/apparaten die niet zijn meegenomen, met per rij de reden.
  • Kwam het model uit Gebruikersmodellen, dan staat er "gepland voor {device}, waar dit model is geregistreerd" en is het apparaat vastgezet.
  • Is de signaalserver onbereikbaar, dan is de lijst gebaseerd op de laatste heartbeat en wordt dat gemeld.

Er is bewust geen vrije apparaatkiezer: de rangschikking zelf is de aanbeveling, en u keurt die goed of overschrijft die door een andere rij te kiezen.


4. De plankaart

Het resultaat is één antwoord — Klaar om te starten op {device} — met de feiten ernaast. Kan het plan niet worden gestart, dan wordt die regel de blokkade; blokkades en waarschuwingen blijven boven de samenvatting staan, waar ze niet weggeklapt kunnen worden.

Blokkades, waarschuwingen en de kanttekeningen van de modelauteur

  • Blokkades (rood) stoppen de start. Bijvoorbeeld: het model past op geen enkele GPU van dit apparaat.
  • Waarschuwingen (oranje) laten doorgaan toe, maar vertellen wat u kunt verwachten.
  • Receptwaarschuwingen (bruin) zijn letterlijk overgenomen uit de handleiding van het recept, met het citaat als bewijs erbij.

Details

Details klapt de volledige lijst met regels uit. Afhankelijk van het model ziet u:

RegelBetekenis
ModelDe repository waarvoor het plan is gemaakt.
EngineDe gekozen inferentie-engine (vLLM, llama.cpp, TensorRT-LLM, Ollama…).
ImageDe exacte container-image en tag.
GPU'sWelke GPU's, met tp= bij tensorparallelisme, of CPU only.
VRAMVrij en totaal geheugen per geselecteerde GPU. Gemarkeerd als waarschuwing wanneer de GPU bezet is.
ContextHet contextvenster waar de vlaggen om vragen.
KwantisatieWelke kwantisatie is gekozen en het geschatte aantal bits per gewicht.
ModelcacheWaar de gewichten vandaan komen — al op het apparaat en gekoppeld aan een pad, of nog niet gedownload. Met wijzigen kiest u een andere hostmap.
GelijktijdigheidHoeveel gelijktijdige verzoeken de instellingen toelaten.
Speculative decodingAan of uit, en waartegen het is afgewogen.
Past nuOf het past met het geheugen dat op dit moment vrij is, niet alleen in theorie.
ApparaatcapaciteitHoe het eruitziet wanneer de GPU inactief is.

Waarom deze instellingen

Standaard ingeklapt. Hierin:

  • Bewijs — waar elke beslissing vandaan komt: genoemd in de documentatie, engine-bron, gedocumenteerd minimum, nieuwste release, gevonden in de registry, gekozen op basis van de gepubliceerde bestandsgroottes, afgewogen tegen het vrije geheugen van dit plan, GPU-plan, waar de gewichten vandaan komen, engine-keuze.
  • Waarnemingen — kwalitatieve opmerkingen over het model of de hardware.
  • Aanpassingen — wat er is gewijzigd om het passend te maken.
  • Suggesties — wat er gewijzigd zou kunnen worden om het beter te maken.
  • Voor u gekozen / Standaardinstelling — de laatste beslissing en de onderbouwing, plus andere opties met de geverifieerde maar niet gekozen alternatieven.
  • Receptnotitie — waar de modelspecifieke vlaggen vandaan komen en voor welke machine dat advies oorspronkelijk was geschreven.

De docker-opdracht tonen

De exacte opdracht die het apparaat uitvoert. Er gaat niets schuil achter het plan.


5. Inloggegevens, toegang en accounts

Onder het plan staat dezelfde serveerlaagconfiguratie als in de wizard, compact weergegeven:

  • Chatinterface — Open WebUI, met een beheerdersaccount dat voor u wordt aangemaakt.
  • API-gateway — LiteLLM: één OpenAI-compatibel endpoint met sleutels, quota's en verzoeklogs.

Als u Inloggegevens, toegang en accounts uitklapt, krijgt u de beheerdersgegevens, de master key, de extra Open WebUI-accounts en de LiteLLM virtual keys, elk met Weergeven, Kopiëren en Opnieuw genereren, plus Publieke URL's om beide diensten van buiten het netwerk te bereiken.

waarschuwing

Kopieer de inloggegevens voordat u start. Cordatus slaat ze niet op en het dialoogvenster sluit zodra de start begint.


6. Starten of overdragen aan de wizard

KnopResultaat
StartenStart het plan. Uitgeschakeld zolang er een blokkade is.
Bewerken in GeavanceerdOpent de startwizard met het apparaat, de image, het model, de GPU's en de vlaggen die de planner heeft bepaald al ingevuld.
Probeer het opnieuwVoert het plannen na een fout opnieuw uit.
AnnulerenSluit zonder iets te starten.

Na de start verschijnen de containers net als elke andere uitrol op de pagina Containers.


Problemen oplossen

Wat u zietWat het betekent
"Dit plan kan niet worden gestart"Direct erboven staat een blokkade. Los die op, of kies een andere apparaatrij.
"past niet" onder Past nuAlleen de gewichten al vullen de geselecteerde GPU's. Kies een gekwantiseerde variant of een groter apparaat.
"De bestanden van het model konden niet op het apparaat worden gelezen"Het geregistreerde modelpad op dat apparaat is onleesbaar. Het plan viel terug op Hugging Face en zal downloaden.
Het plannen komt niet voorbij Uw apparaten controlerenGeen enkel apparaat is online, of de signaalserver is onbereikbaar. Controleer de pagina Apparaten.
Er wordt om een token gevraagd dat u al hebt opgeslagenHet opgeslagen token heeft geen toegang tot deze repository. Plak een token dat dat wel heeft.