AI-start
AI-start is de weg naar een draaiend model in één dialoogvenster. U geeft een Hugging Face-repository-id op — of u drukt op AI-start op een rij in de modellijst, waarmee die alvast wordt ingevuld — en Cordatus regelt de rest: welk van uw apparaten het model kan draaien, welke engine, welke container-image, hoeveel GPU's, welke kwantisatie, welke context en welke vlaggen.
Er wordt niets gestart voordat u het plan hebt gezien.
Waar u het start
| Startpunt | Wat er gebeurt |
|---|---|
| LLM-modellen → Hugging Face, de knop AI-start op een modelrij | Het model is al gekozen; het dialoogvenster hoeft alleen een apparaat te kiezen en te plannen. |
| LLM-modellen → Gebruikersmodellen, de knop AI-start op een modelrij | Het model en het apparaat zijn al bekend — het plan wordt gemaakt voor het apparaat waarop het model staat. |
| Geopend zonder model | Het dialoogvenster vraagt eerst om een Hugging Face-model-id (bijvoorbeeld Qwen/Qwen3-8B). Druk op Enter om te beginnen. |
Naast AI-start staat altijd Handmatig → Handmatig uitvoeren met…, dat u in plaats daarvan naar de startwizard brengt.
1. Afgeschermde modellen en tokens
Als de modellijst al weet dat de repository afgeschermd (gated) is, vraagt het dialoogvenster vóór het plannen om een Hugging Face-token — een afgeschermd model heeft er een nodig om zowel de configuratie te lezen als de gewichten te downloaden, dus vooraf vragen bespaart een zeker mislukte ronde.
U kunt:
- Een opgeslagen token gebruiken uit uw tokenkluis, of
- er een plakken in het veld eronder (
hf_…).
Dit veld is een API-token, geen inlogwachtwoord. Cordatus voorkomt bewust dat de wachtwoordmanager van de browser het automatisch invult.
2. Plannen
Plannen bestaat uit zes fasen, en het dialoogvenster toont in welke fase het zit in plaats van één draaiend icoontje:
- Uw apparaten controleren — welke apparaten online zijn en wat ze rapporteren.
- Het model lezen —
config.jsonen de bestandslijst van de repository. Staat het model al op het apparaat, dan wordt dit van het apparaat zelf gelezen in plaats van van Hugging Face. - Een inferentie-engine kiezen
- Een container-image zoeken
- GPU's en context toewijzen
- Engine-argumenten afstemmen
Als het klaar is, staat er Plan gereed.
Heeft Cordatus een modelpad geregistreerd voor het apparaat maar kan het de bestanden daar niet lezen, dan verschijnt boven het resultaat een waarschuwing: "De bestanden van het model konden niet op het apparaat worden gelezen … Het plan is teruggevallen op Hugging Face." Dat is de oorzaak van een download die daarop volgt — herstel het pad, niet de repository-id of het token.
3. Het doelapparaat kiezen
Onder het invoerveld toont Cordatus de apparaten die dit model kunnen draaien, gerangschikt, met het gekozen apparaat geselecteerd:
\{n\} of \{m\} device(s) can run this model- Apparaten die niet zijn meegenomen, staan achter Toon {n} apparaat/apparaten die niet zijn meegenomen, met per rij de reden.
- Kwam het model uit Gebruikersmodellen, dan staat er "gepland voor {device}, waar dit model is geregistreerd" en is het apparaat vastgezet.
- Is de signaalserver onbereikbaar, dan is de lijst gebaseerd op de laatste heartbeat en wordt dat gemeld.
Er is bewust geen vrije apparaatkiezer: de rangschikking zelf is de aanbeveling, en u keurt die goed of overschrijft die door een andere rij te kiezen.
4. De plankaart
Het resultaat is één antwoord — Klaar om te starten op {device} — met de feiten ernaast. Kan het plan niet worden gestart, dan wordt die regel de blokkade; blokkades en waarschuwingen blijven boven de samenvatting staan, waar ze niet weggeklapt kunnen worden.
Blokkades, waarschuwingen en de kanttekeningen van de modelauteur
- Blokkades (rood) stoppen de start. Bijvoorbeeld: het model past op geen enkele GPU van dit apparaat.
- Waarschuwingen (oranje) laten doorgaan toe, maar vertellen wat u kunt verwachten.
- Receptwaarschuwingen (bruin) zijn letterlijk overgenomen uit de handleiding van het recept, met het citaat als bewijs erbij.
Details
Details klapt de volledige lijst met regels uit. Afhankelijk van het model ziet u:
| Regel | Betekenis |
|---|---|
| Model | De repository waarvoor het plan is gemaakt. |
| Engine | De gekozen inferentie-engine (vLLM, llama.cpp, TensorRT-LLM, Ollama…). |
| Image | De exacte container-image en tag. |
| GPU's | Welke GPU's, met tp= bij tensorparallelisme, of CPU only. |
| VRAM | Vrij en totaal geheugen per geselecteerde GPU. Gemarkeerd als waarschuwing wanneer de GPU bezet is. |
| Context | Het contextvenster waar de vlaggen om vragen. |
| Kwantisatie | Welke kwantisatie is gekozen en het geschatte aantal bits per gewicht. |
| Modelcache | Waar de gewichten vandaan komen — al op het apparaat en gekoppeld aan een pad, of nog niet gedownload. Met wijzigen kiest u een andere hostmap. |
| Gelijktijdigheid | Hoeveel gelijktijdige verzoeken de instellingen toelaten. |
| Speculative decoding | Aan of uit, en waartegen het is afgewogen. |
| Past nu | Of het past met het geheugen dat op dit moment vrij is, niet alleen in theorie. |
| Apparaatcapaciteit | Hoe het eruitziet wanneer de GPU inactief is. |
Waarom deze instellingen
Standaard ingeklapt. Hierin:
- Bewijs — waar elke beslissing vandaan komt: genoemd in de documentatie, engine-bron, gedocumenteerd minimum, nieuwste release, gevonden in de registry, gekozen op basis van de gepubliceerde bestandsgroottes, afgewogen tegen het vrije geheugen van dit plan, GPU-plan, waar de gewichten vandaan komen, engine-keuze.
- Waarnemingen — kwalitatieve opmerkingen over het model of de hardware.
- Aanpassingen — wat er is gewijzigd om het passend te maken.
- Suggesties — wat er gewijzigd zou kunnen worden om het beter te maken.
- Voor u gekozen / Standaardinstelling — de laatste beslissing en de onderbouwing, plus andere opties met de geverifieerde maar niet gekozen alternatieven.
- Receptnotitie — waar de modelspecifieke vlaggen vandaan komen en voor welke machine dat advies oorspronkelijk was geschreven.
De docker-opdracht tonen
De exacte opdracht die het apparaat uitvoert. Er gaat niets schuil achter het plan.
5. Inloggegevens, toegang en accounts
Onder het plan staat dezelfde serveerlaagconfiguratie als in de wizard, compact weergegeven:
- Chatinterface — Open WebUI, met een beheerdersaccount dat voor u wordt aangemaakt.
- API-gateway — LiteLLM: één OpenAI-compatibel endpoint met sleutels, quota's en verzoeklogs.
Als u Inloggegevens, toegang en accounts uitklapt, krijgt u de beheerdersgegevens, de master key, de extra Open WebUI-accounts en de LiteLLM virtual keys, elk met Weergeven, Kopiëren en Opnieuw genereren, plus Publieke URL's om beide diensten van buiten het netwerk te bereiken.
Kopieer de inloggegevens voordat u start. Cordatus slaat ze niet op en het dialoogvenster sluit zodra de start begint.
6. Starten of overdragen aan de wizard
| Knop | Resultaat |
|---|---|
| Starten | Start het plan. Uitgeschakeld zolang er een blokkade is. |
| Bewerken in Geavanceerd | Opent de startwizard met het apparaat, de image, het model, de GPU's en de vlaggen die de planner heeft bepaald al ingevuld. |
| Probeer het opnieuw | Voert het plannen na een fout opnieuw uit. |
| Annuleren | Sluit zonder iets te starten. |
Na de start verschijnen de containers net als elke andere uitrol op de pagina Containers.
Problemen oplossen
| Wat u ziet | Wat het betekent |
|---|---|
| "Dit plan kan niet worden gestart" | Direct erboven staat een blokkade. Los die op, of kies een andere apparaatrij. |
| "past niet" onder Past nu | Alleen de gewichten al vullen de geselecteerde GPU's. Kies een gekwantiseerde variant of een groter apparaat. |
| "De bestanden van het model konden niet op het apparaat worden gelezen" | Het geregistreerde modelpad op dat apparaat is onleesbaar. Het plan viel terug op Hugging Face en zal downloaden. |
| Het plannen komt niet voorbij Uw apparaten controleren | Geen enkel apparaat is online, of de signaalserver is onbereikbaar. Controleer de pagina Apparaten. |
| Er wordt om een token gevraagd dat u al hebt opgeslagen | Het opgeslagen token heeft geen toegang tot deze repository. Plak een token dat dat wel heeft. |