Ga naar hoofdinhoud

Snelstartgids

Begin binnen 10 minuten met het implementeren van AI-applicaties op Cordatus. Deze pagina is een eenvoudige handleiding. Volg voor de volledige stappen, screenshots en video's de links in elke sectie.

Vereisten

  • Een Cordatus-account met de juiste rechten
  • Minstens één apparaat verbonden met Cordatus (status: Online of Connected)
  • Een apparaat met GPU-ondersteuning (aanbevolen voor LLM-applicaties)
  • De Cordatus Client geïnstalleerd en actief op uw apparaat
tip

Heeft u nog geen apparaat verbonden? Doorloop dan eerst de Device Hub Quickstart.


Aan de slag in 10 minuten

1. Beschikbare applicaties bekijken (1 minuut)

  1. Ga naar Containers > Applications in het linkermenu
  2. Blader door de applicatiecatalogus:
    • vLLM (LLM-inference met hoge doorvoer)
    • TensorRT-LLM (geoptimaliseerde NVIDIA-inference)
    • Ollama (eenvoudige lokale modellen)
    • NVIDIA Dynamo (gedistribueerd, meerdere GPU's)
    • NVIDIA VSS (video-analyse)
  3. Klik op een applicatie om de detailpagina te bekijken
  4. Controleer de ondersteunde platforms en beschikbare Docker-image-versies

Volledige details → Application Launch Guide


2. Uw eerste applicatie starten (3 minuten)

Voorbeeld: vLLM implementeren met een klein model

  1. Klik op Start Application op de detailpagina van vLLM
  2. Selecteer apparaat: kies uw verbonden apparaat
  3. Selecteer versie: kies de nieuwste Docker-image-versie
    • Groen vinkje = al gedownload
    • Downloadpictogram = wordt nog gedownload
  4. Klik op Next om naar Advanced Settings te gaan

Volledige details → Application Launch Guide - Sectie 4


3. Basisinstellingen configureren (3 minuten)

  • Algemene instellingen:

    • Environment Name: laat leeg voor een automatisch gegenereerde naam (of voer een aangepaste naam in, zoals vllm-llama2-7b)
    • Select GPU: kies All GPU of selecteer specifieke GPU's
    • Resource Limits: houd de standaardwaarden aan (of pas de CPU-/RAM-limieten aan)
    • Enable Open Web UI: vink dit vakje aan (creëert automatisch een chatinterface)
  • Modelselectie:

    • Ga naar het tabblad Cordatus Models
    • Zoek naar llama-2-7b of kies een ander klein model (7B of 13B aanbevolen voor uw eerste implementatie)
    • Klik op het model om het te selecteren
  • Overige instellingen (nu overslaan):

    • Docker Options: automatisch geconfigureerd
    • Environment Variables: vooraf ingevuld met standaardwaarden
    • Engine Arguments: geoptimaliseerd voor het geselecteerde model

Volledige details → Application Launch Guide - Sectie 5


4. De container starten (1 minuut)

  1. Klik op de knop Start Environment (rechtsonder)
  2. Voer uw sudo-wachtwoord in wanneer daarom wordt gevraagd
  3. Bevestig het downloaden als de Docker-image nog gedownload moet worden
  4. Wacht tot de implementatie voltooid is (1-5 minuten, afhankelijk van de grootte van de image)

Wat er op de achtergrond gebeurt:

  • Cordatus verbindt met uw apparaat
  • Downloadt de Docker-image (indien nodig)
  • Maakt de container aan en start deze
  • Configureert netwerken en volumes
  • Start de Open Web UI-container (indien ingeschakeld)

Volledige details → Application Launch Guide - Sectie 6


5. De implementatie verifiëren (2 minuten)

  1. Ga naar Containers > Containers in het linkermenu
  2. Zoek uw nieuw aangemaakte containergroep
  3. Controleer of de status Running weergeeft
  4. Klik op See the Container Informations (menu met drie puntjes)
  5. Controleer het tabblad Logs — u zou berichten over het laden van het model moeten zien
  6. Ga naar het tabblad Ports en kopieer de lokale URL

Toegang tot uw applicatie:

  • API-endpoint: open de lokale URL in de browser (toont de API-documentatie)
  • Open Web UI: indien ingeschakeld, zoek de tweede container in de groep en open de bijbehorende URL
  • Testen met curl:
    curl http://localhost:8000/v1/models

Volledige details → Container Management Guide - Sectie 3.6


Verwacht resultaat

Na het voltooien van deze stappen zou u het volgende moeten hebben:

  • Container actief

    • Status: Running (groene indicator)
    • Logs tonen dat het model succesvol is geladen
    • API-endpoint toegankelijk via de lokale URL
  • Open Web UI actief (indien ingeschakeld)

    • Tweede container in de groep toont Running
    • Chatinterface toegankelijk via de browser
    • Berichten verzenden en AI-antwoorden ontvangen is mogelijk
  • Applicatie in de containerlijst

    • Zichtbaar onder Containers > Containers
    • Containergroep correct georganiseerd
    • Alle onderdelen zijn gezond

Wat is de volgende stap?

VRAM Calculator ontdekken (5 minuten)

Bereken de VRAM-vereisten voordat u grotere modellen implementeert:

  1. Ga naar VRAM Calculator in het hoofdmenu
  2. Model selecteren: kies een groter model (bijv. Llama-2-70B)
  3. GPU selecteren: kies uw GPU-model
  4. Resultaten controleren: kijk of de VRAM voldoende is
  5. Instellingen aanpassen: probeer verschillende quantization-niveaus (INT8, INT4)

U leert:

  • Geheugenvereisten berekenen voorafgaand aan de implementatie
  • Verschillende quantization-opties vergelijken
  • De optimale batchgrootte en sequentielengte bepalen
  • Implementaties met meerdere GPU's plannen

Volledige details → VRAM Calculator User Guide


Uw eigen modellen toevoegen (10 minuten)

Gebruik modellen die u al op uw apparaat hebt gedownload:

  1. Modelpaden configureren:

    • Verbind met uw apparaat
    • Ga naar Metrics > Model Info
    • Definieer paden voor Huggingface, Ollama of NVIDIA NIM
  2. Scannen naar modellen:

    • Ga naar de pagina LLM Models
    • Klik op Explore Models on Your Device
    • Klik op Start Scanning
    • Selecteer modellen om toe te voegen aan Cordatus
  3. User Model implementeren:

    • Ga naar het tabblad LLM Models > User Models
    • Klik op Deploy naast een model
    • Selecteer de inference-engine
    • Configureer en start

Volledige details → User Models and Model Transfer Guide


Geavanceerde applicaties implementeren (15-30 minuten)

Probeer complexere implementaties:

NVIDIA AI Dynamo (gedistribueerde inference met meerdere GPU's):

  • Configureer de verwerkingsmodus (Aggregated/Disaggregated)
  • Stel de routerstrategie in (KV-Aware aanbevolen)
  • Maak meerdere workers aan met GPU-toewijzingen
  • Start de gedistribueerde inference-pipeline

Volledige details → NVIDIA AI Dynamo Creation Guide

NVIDIA VSS (video-analyse):

  • Configureer de hoofdcontainer VSS
  • Stel de componenten VLM, LLM, Embed en Rerank in
  • Kies ervoor om nieuwe componenten te maken of bestaande te gebruiken
  • Implementeer de volledige videoanalysepipeline

Volledige details → NVIDIA VSS Creation Guide


Uw containers beheren (5 minuten)

Leer de containerbeheer-bewerkingen:

  1. Containers starten/stoppen:

    • Klik op de knoppen Start/Stop voor een container
    • Selecteer meerdere containers voor bulkbewerkingen
  2. Containerinformatie bekijken:

    • Volg realtime logs
    • Bekijk configuratieparameters
    • Controleer poort-mappings
  3. Openbare URL's genereren:

    • Maak uw applicaties extern toegankelijk
    • Deel toegang met teamleden
  4. Open Web UI creëren:

    • Voeg een chatinterface toe aan bestaande LLM-containers
    • Genereer openbare URL's om te delen
  5. Containers dupliceren:

    • Kopieer bestaande configuraties
    • Pas instellingen aan en implementeer opnieuw

Volledige details → Container Management Guide


Snelle tips voor probleemoplossing

Container start niet:

  • Controleer of de apparaatstatus Connected is
  • Controleer of de GPU beschikbaar en niet in gebruik is
  • Bekijk de containerlogs voor foutmeldingen
  • Zorg voor voldoende schijfruimte voor de Docker-image

Onvoldoende VRAM-foutmelding:

  • Gebruik de VRAM Calculator om de vereisten te controleren
  • Probeer een lagere quantization (FP16 → INT8 → INT4)
  • Verlaag de batchgrootte of sequentielengte
  • Voeg meer GPU's toe of gebruik een kleiner model

Model niet gevonden:

  • Voor Custom Models: controleer of de modelnaam correct is
  • Voor User Models: controleer of de modelpaden zijn geconfigureerd
  • Controleer of het model toegankelijk is vanuit de container
  • Bekijk de volume-mappings in Docker Options

Open Web UI werkt niet:

  • Controleer of de container actief is
  • Controleer of de poort niet al in gebruik is
  • Bekijk de logs van de Open Web UI-container
  • Zorg voor netwerkconnectiviteit tussen containers

Snel overzicht

Applicatietypes

TypeToepassingComplexiteitOpzettijd
Standard AppsEenvoudige containersLaag5 min
LLM EnginesModel-inferenceGemiddeld5 min
NVIDIA DynamoGedistribueerd met meerdere GPU'sHoog5 min
NVIDIA VSSVideo-analyseHoog10 min

Aanbevolen GPU-geheugen

ModelgrootteQuantizationMinimale VRAMAanbevolen GPU
7BINT44-6 GBRTX 3090, RTX 4090
7BINT88-10 GBRTX 4090, A10
13BINT48-10 GBRTX 4090, A10
13BINT814-16 GBA10, A100 40GB
70BINT440-50 GBA100 80GB, 2x A100 40GB
70BINT880-90 GBA100 80GB, 2x A100 80GB

Belangrijkste snelkoppelingen

  • Containers > Applications: blader door de applicatiecatalogus
  • Containers > Containers: beheer actieve containers
  • LLM Models: toegang tot Cordatus Models en User Models
  • VRAM Calculator: berekening van geheugenvereisten
  • Device Metrics: bekijk GPU-/CPU-/RAM-gebruik

Hulp nodig?

Voor gedetailleerde documentatie met screenshots en video's: