Ana içeriğe geç

Hızlı Başlangıç

Kendi donanımınızda yaklaşık 10 dakikada servis veren bir model elde edin. Bu sayfa kısa sürümdür; her bölüm tam rehbere bağlantı verir.

Bir model seçin, AI Başlatma planlasın, başlatın ve oluşturduğu arayüzde modelle konuşun

 


Ön koşullar

  • Konteyner izinleri olan bir Cordatus hesabı
  • Cordatus'a bağlı ve Çevrimiçi görünen en az bir cihaz
  • O cihazda bir GPU (LLM uygulamaları için önerilir)
  • Üzerinde kurulu ve çalışan Cordatus Client
ipucu

Henüz cihazınız yok mu? Önce Device Hub hızlı başlangıcını yapın — LLM Başlatıcı'da hiçbir şey cihaz olmadan çalışmaz.


En hızlı yol: AI Başlatma (yaklaşık 4 dakika)

Tek isteğiniz çalışan bir modelse sihirbazı tamamen atlayın.

  1. LLM Başlatıcı → LLM Modelleri'ne gidin.
  2. Küçük bir model arayın — ilk deneme için Qwen/Qwen3-8B iyi bir seçimdir.
  3. Satırındaki AI Başlatma'ya basın.
  4. Altı planlama fazını izleyin. Plan hazır dediğinde özet satırını okuyun: {device} üzerinde başlatmaya hazır.
  5. Seçtiği motoru, imajı, GPU'ları, nicemlemeyi ve bağlamı görmek isterseniz Detaylar'ı, her birinin gerekçesi için Bu ayarların nedeni'ni açın.
  6. Planın altında Sohbet arayüzü'nü açın ve gösterdiği kimlik bilgilerini kopyalayın.
  7. Başlat'a basın.

Hepsi bu kadar. Dağıtımınızı doğrulayın bölümüne geçin.

AI Başlatma


Tam yol: başlatma sihirbazı (yaklaşık 10 dakika)

1. Uygulamalara göz atın (1 dakika)

LLM Başlatıcı → Uygulamalar. Cihaz türüne göre filtreleyin — Sunucu - İş İstasyonu, Jetson ya da DGX Spark — ve bir motor seçin:

  • vLLM — yüksek verimli LLM çıkarımı
  • TensorRT-LLM — NVIDIA'nın optimize motoru
  • Ollama — basit yerel modeller
  • llama.cpp — GGUF ağırlıkları, Jetson dâhil
  • NVIDIA Dynamo — dağıtık çoklu GPU
  • NVIDIA VSS — video arama ve özetleme

Birini Detayları Görüntüle ile açın ve Sürümler sekmesine bakın.

Başlatma Rehberi

2. Sihirbazı başlatın (1 dakika)

Tek Cihazda Uygulama Başlat'a basın.

Adım 1 — Cihaz Seç. Bağlı bir cihaz seçin. Alt bilgi {device} cihazına dağıtılıyor diye onaylar.

Adım 2 — Sürüm Seç. Yalnızca uyumlu imajlar listelenir. Her biri şöyle işaretlidir:

  • İndirildi — zaten cihazda
  • İndirilecek — başlatmada çekilir
  • Uyumsuz — nedeniyle birlikte, örneğin sürücü sürümü uyuşmazlığı

İleri'ye basın.

3. Yapılandırın (4 dakika)

  1. adım bir raydır. Yukarıdan aşağı ilerleyin.

Profil (ekranın üstünde) — Hızlı başlangıç'a basın. Bu sohbet arayüzünü açar ve başka hiçbir şeye dokunmaz.

Model

  1. Model merkezi kartında kalın.
  2. Küçük bir model seçin — ilk dağıtım için 7B ya da 8B.
  3. Kataloğun altındaki uyum satırını okuyun. Görmek istediğiniz şudur: "{model} seçiminize rahatça sığıyor."

İşlem

  1. Bir GPU seçin ya da Tümünü kullan'ı açın.
  2. Ana makine sınırları'nı Otomatik'te bırakın.

Erişim — Hızlı başlangıç profili tarafından zaten ayarlandı. Gösterdiği kimlik bilgilerini kopyalayın; bir kez gösterilirler.

Geçersiz Kılmalar — atlayın. Uygulamanın varsayılanları zaten doğrudur.

İncele ve başlatOluşan komut'u ve Oluşturulacak konteynerler'i okuyun. Bir engelleyici listelendiyse üzerine tıklayın: sizi onu düzelten bölmeye götürür.

Başlatma Rehberi

4. Başlatın (1 dakika, artı imaj çekme süresi)

Ortamı Başlat'a basın.

Arka planda Cordatus cihaza bağlanır, imaj yoksa çeker, konteynerleri oluşturur, ağı ve volume'ları yapılandırır ve servis katmanını yanında başlatır.

İlk çekme birkaç dakika sürebilir. Bu sırada konteyner İndiriliyor olarak görünür.


Dağıtımınızı doğrulayın

  1. LLM Başlatıcı → Konteynerler'e gidin.
  2. Yeni konteyner grubu'nu bulun ve durumunu kontrol edin.
  3. Grubu , sonra motorda Konteyner Bilgileri'ne basın.
  4. Loglar — modelin yüklendiğini görmelisiniz.
  5. Portlar — yerel adresi kopyalayın.

Test edin:

curl http://<cihaz-ip>:<port>/v1/models

Sonra Open WebUI konteynerinin adresini tarayıcıda açın ve kopyaladığınız yönetici bilgileriyle giriş yapın.

Konteynerler


Beklenen sonuç

  • Motor konteyneri çalışıyor ve loglarında model yükleme mesajları var
  • Open WebUI konteyneri çalışıyor ve modelle sohbet edebiliyorsunuz
  • İkisi de Konteynerler altında tek bir grup olarak görünüyor
  • Gateway'i de açtıysanız bir LiteLLM konteyneri (artı PostgreSQL, Redis ve Prometheus) çalışıyor ve model içine kaydedilmiş durumda

Sırada ne var

Dağıtmadan önce bir modelin sığdığını kontrol edin (5 dakika)

LLM Başlatıcı → VRAM Hesaplayıcı:

  1. Daha büyük bir model arayın, örneğin Llama-2-70B.
  2. Bir GPU seçin — ya da gerçek donanımınızı kullanmak için Cihaz GPU'larını Seç.
  3. Gerçekten sunmayı düşündüğünüz dizi uzunluğunu ve batch boyutunu ayarlayın.
  4. Hesaplama Türü'nü Aktivasyon Dahil'e alın.
  5. VRAM Yeterli diyene kadar nicemlemeleri karşılaştırın.

VRAM Hesaplayıcı

Cihazınızda hâlihazırda duran modelleri kullanın (10 dakika)

  1. Cihazlar → cihazınız → Modeller → Depolama Yolları — HuggingFace, Ollama ve NIM yollarını kaydedin.
  2. LLM Modelleri → Kullanıcı Modelleri → Cihazlarınızdaki Modelleri Keşfedin — cihazı seçin, Taramayı başlat, hedef motorları seçin, {n} model ekle.
  3. Bunlardan birinde AI Başlatma'ya basın — plan, modeli barındıran cihaz için yapılır ve hiçbir şey indirilmez.

Kullanıcı Modelleri

Bir modeli cihaza indirin (5 dakika)

LLM Modelleri → İndir, herhangi bir satırda: cihazı, kayıtlı dizini ve nicemlemeyi seçin, depo kapılıysa bir token ekleyin ve indirmeyi cihaza bırakın.

LLM Modelleri

Düzgün biçimde sunun (10 dakika)

LLM Başlatıcı → Servis Katmanı: bir LiteLLM gateway'i kurun, çalışan modelinizi içine kaydedin ve istemcilerinize master key vermek yerine kapsamlı virtual key'ler verin.

Servis Katmanı

Daha ileri gidin (15–30 dakika)

  • NVIDIA AI Dynamo — toplu ve ayrıştırılmış modlar, yönlendiriciler, KV konnektörleri ve sürükle-bırak GPU hattı. → NVIDIA AI Dynamo
  • NVIDIA VSS — her servisi yeni, var olan ya da uzak olabilen beş servisli bir video hattı. → NVIDIA VSS
  • Sparkrun — bir DGX Spark cluster'ında çok düğümlü çıkarım. → Sparkrun Cluster'ları
  • Jetson AI Lab — NVIDIA'nın kataloğu, tek adımda bir Jetson'da başlatılır. → Jetson AI Lab

Elinizdekileri yönetin (5 dakika)

Konteynerleri tek tek ya da grup hâlinde başlatıp durdurun, bir varyant denemek için birini çoğaltın, genel URL'ler üretin, API kullanım örneklerini okuyun ve artık ihtiyacınız olmayanı silin.

Konteynerler


Sorun giderme

Başlat düğmesi pasif İncele ve başlat'ı açın. Her engelleyici orada listelenir ve her biri sizi onu düzelten bölmeye götüren bir düğmedir. En yaygın olanlar "GPU seçilmedi" ve "model seçilmedi"dir.

Konteyner başlamıyor

  • Cihaz hâlâ Çevrimiçi mi?
  • İmaj için disk alanı var mı?
  • Konteynerin Loglar sekmesini okuyun — hata neredeyse her zaman oradadır.

VRAM yetersiz

  • VRAM Hesaplayıcı'da Aktivasyon Dahil ile kontrol edin.
  • Nicemlemeyi düşürün (BF16 → FP8 → INT4), dizi uzunluğunu kısaltın, batch boyutunu azaltın ya da GPU ekleyin.
  • Sihirbazın uyum danışmanı bunu daha başlamadan uyarır: "sığıyor ama kıl payı", KV önbelleği için az yer kaldığı anlamına gelir.

Model bulunamadı

  • Özel model: repo kimliğini huggingface.co'da göründüğü gibi tam olarak yazdığınızı kontrol edin.
  • Kullanıcı Modelleri: model yollarının hedef cihazda da kayıtlı olduğunu kontrol edin.
  • Konteyner geçersiz kılma sekmesindeki volume eşlemesini kontrol edin.

Kapılı model / 401 LLM Modelleri'ndeki satır token gerekip gerekmediğini söyler. Kasanızdan bir token ekleyin ya da Ortam geçersiz kılma sekmesine yapıştırın.

Open WebUI hiç model göstermiyor

  • Motor konteyneri gerçekten çalışıyor mu?
  • Bir gateway'e yönlendirilmişse model gateway'e kaydedildi mi? Servis Katmanı → Sunulan'ı kontrol edin.

AI Başlatma "Modelin dosyaları cihazda okunamadı" diyor O cihazdaki kayıtlı model yolu okunamıyor. Yolu düzeltin; plan Hugging Face'e geri döndü ve aksi hâlde ağırlıkları yeniden indirecek.


Hızlı başvuru

Uygulama türleri

TürKullanım senaryosuKarmaşıklıkKurulum süresi
AI BaşlatmaSizin için planlanan herhangi bir Hugging Face modeliEn düşük2 dk
Standart uygulamalarTemel konteynerlerDüşük5 dk
LLM motorlarıTam denetimle model çıkarımıOrta5 dk
NVIDIA DynamoDağıtık çoklu GPUYüksek10 dk
NVIDIA VSSVideo analiz hattıYüksek15 dk
SparkrunÇok düğümlü DGX SparkYüksek20 dk (artı cluster kurulumu)

Kabaca GPU bellek rehberi

Model boyutuNicemlemeAsgari VRAMTipik GPU
7–8BINT44–6 GBRTX 3090, RTX 4090
7–8BINT88–10 GBRTX 4090, A10
13BINT48–10 GBRTX 4090, A10
13BINT814–16 GBA10, A100 40GB
70BINT440–50 GBA100 80GB, 2× A100 40GB
70BINT880–90 GBA100 80GB, 2× A100 80GB

Bunlar yalnızca ağırlıklardır. Sunmayı düşündüğünüz bağlam uzunluğu ve batch boyutu için KV önbelleğini ekleyin — VRAM Hesaplayıcı tam da bunun içindir.

Neyin nerede olduğu

Şunu yapmak istiyorum…Buraya gidin
Uygulamalara göz atmak ve başlatmakLLM Başlatıcı → Uygulamalar
Neyin çalıştığını görmekLLM Başlatıcı → Konteynerler
Model bulmak ya da indirmekLLM Başlatıcı → LLM Modelleri
Cihazda zaten duran bir modeli kullanmakLLM Modelleri → Kullanıcı Modelleri
Gateway ya da sohbet arayüzünü tek başına çalıştırmakLLM Başlatıcı → Servis Katmanı
Çok düğümlü çıkarım kurmakLLM Başlatıcı → Sparkrun Cluster'ları
Bir Jetson AI Lab modeli çalıştırmakLLM Başlatıcı → Jetson AI Lab
Bir modelin sığıp sığmadığını kontrol etmekLLM Başlatıcı → VRAM Hesaplayıcı
Kendi imajınızı yüklemekLLM Başlatıcı → Özel Registry
Model yollarını kaydetmekCihazlar → cihaz → Modeller

Yardım alın