Hızlı Başlangıç
Kendi donanımınızda yaklaşık 10 dakikada servis veren bir model elde edin. Bu sayfa kısa sürümdür; her bölüm tam rehbere bağlantı verir.
Ön koşullar
- Konteyner izinleri olan bir Cordatus hesabı
- Cordatus'a bağlı ve Çevrimiçi görünen en az bir cihaz
- O cihazda bir GPU (LLM uygulamaları için önerilir)
- Üzerinde kurulu ve çalışan Cordatus Client
Henüz cihazınız yok mu? Önce Device Hub hızlı başlangıcını yapın — LLM Başlatıcı'da hiçbir şey cihaz olmadan çalışmaz.
En hızlı yol: AI Başlatma (yaklaşık 4 dakika)
Tek isteğiniz çalışan bir modelse sihirbazı tamamen atlayın.
- LLM Başlatıcı → LLM Modelleri'ne gidin.
- Küçük bir model arayın — ilk deneme için
Qwen/Qwen3-8Biyi bir seçimdir. - Satırındaki AI Başlatma'ya basın.
- Altı planlama fazını izleyin. Plan hazır dediğinde özet satırını okuyun: {device} üzerinde başlatmaya hazır.
- Seçtiği motoru, imajı, GPU'ları, nicemlemeyi ve bağlamı görmek isterseniz Detaylar'ı, her birinin gerekçesi için Bu ayarların nedeni'ni açın.
- Planın altında Sohbet arayüzü'nü açın ve gösterdiği kimlik bilgilerini kopyalayın.
- Başlat'a basın.
Hepsi bu kadar. Dağıtımınızı doğrulayın bölümüne geçin.
Tam yol: başlatma sihirbazı (yaklaşık 10 dakika)
1. Uygulamalara göz atın (1 dakika)
LLM Başlatıcı → Uygulamalar. Cihaz türüne göre filtreleyin — Sunucu - İş İstasyonu, Jetson ya da DGX Spark — ve bir motor seçin:
- vLLM — yüksek verimli LLM çıkarımı
- TensorRT-LLM — NVIDIA'nın optimize motoru
- Ollama — basit yerel modeller
- llama.cpp — GGUF ağırlıkları, Jetson dâhil
- NVIDIA Dynamo — dağıtık çoklu GPU
- NVIDIA VSS — video arama ve özetleme
Birini Detayları Görüntüle ile açın ve Sürümler sekmesine bakın.
2. Sihirbazı başlatın (1 dakika)
Tek Cihazda Uygulama Başlat'a basın.
Adım 1 — Cihaz Seç. Bağlı bir cihaz seçin. Alt bilgi {device} cihazına dağıtılıyor diye onaylar.
Adım 2 — Sürüm Seç. Yalnızca uyumlu imajlar listelenir. Her biri şöyle işaretlidir:
- İndirildi — zaten cihazda
- İndirilecek — başlatmada çekilir
- Uyumsuz — nedeniyle birlikte, örneğin sürücü sürümü uyuşmazlığı
İleri'ye basın.
3. Yapılandırın (4 dakika)
- adım bir raydır. Yukarıdan aşağı ilerleyin.
Profil (ekranın üstünde) — Hızlı başlangıç'a basın. Bu sohbet arayüzünü açar ve başka hiçbir şeye dokunmaz.
Model
- Model merkezi kartında kalın.
- Küçük bir model seçin — ilk dağıtım için 7B ya da 8B.
- Kataloğun altındaki uyum satırını okuyun. Görmek istediğiniz şudur: "{model} seçiminize rahatça sığıyor."
İşlem
- Bir GPU seçin ya da Tümünü kullan'ı açın.
- Ana makine sınırları'nı Otomatik'te bırakın.
Erişim — Hızlı başlangıç profili tarafından zaten ayarlandı. Gösterdiği kimlik bilgilerini kopyalayın; bir kez gösterilirler.
Geçersiz Kılmalar — atlayın. Uygulamanın varsayılanları zaten doğrudur.
İncele ve başlat — Oluşan komut'u ve Oluşturulacak konteynerler'i okuyun. Bir engelleyici listelendiyse üzerine tıklayın: sizi onu düzelten bölmeye götürür.
4. Başlatın (1 dakika, artı imaj çekme süresi)
Ortamı Başlat'a basın.
Arka planda Cordatus cihaza bağlanır, imaj yoksa çeker, konteynerleri oluşturur, ağı ve volume'ları yapılandırır ve servis katmanını yanında başlatır.
İlk çekme birkaç dakika sürebilir. Bu sırada konteyner İndiriliyor olarak görünür.
Dağıtımınızı doğrulayın
- LLM Başlatıcı → Konteynerler'e gidin.
- Yeni konteyner grubu'nu bulun ve durumunu kontrol edin.
- Grubu Aç, sonra motorda Konteyner Bilgileri'ne basın.
- Loglar — modelin yüklendiğini görmelisiniz.
- Portlar — yerel adresi kopyalayın.
Test edin:
curl http://<cihaz-ip>:<port>/v1/models
Sonra Open WebUI konteynerinin adresini tarayıcıda açın ve kopyaladığınız yönetici bilgileriyle giriş yapın.
Beklenen sonuç
- Motor konteyneri çalışıyor ve loglarında model yükleme mesajları var
- Open WebUI konteyneri çalışıyor ve modelle sohbet edebiliyorsunuz
- İkisi de Konteynerler altında tek bir grup olarak görünüyor
- Gateway'i de açtıysanız bir LiteLLM konteyneri (artı PostgreSQL, Redis ve Prometheus) çalışıyor ve model içine kaydedilmiş durumda
Sırada ne var
Dağıtmadan önce bir modelin sığdığını kontrol edin (5 dakika)
LLM Başlatıcı → VRAM Hesaplayıcı:
- Daha büyük bir model arayın, örneğin Llama-2-70B.
- Bir GPU seçin — ya da gerçek donanımınızı kullanmak için Cihaz GPU'larını Seç.
- Gerçekten sunmayı düşündüğünüz dizi uzunluğunu ve batch boyutunu ayarlayın.
- Hesaplama Türü'nü Aktivasyon Dahil'e alın.
- VRAM Yeterli diyene kadar nicemlemeleri karşılaştırın.
Cihazınızda hâlihazırda duran modelleri kullanın (10 dakika)
- Cihazlar → cihazınız → Modeller → Depolama Yolları — HuggingFace, Ollama ve NIM yollarını kaydedin.
- LLM Modelleri → Kullanıcı Modelleri → Cihazlarınızdaki Modelleri Keşfedin — cihazı seçin, Taramayı başlat, hedef motorları seçin, {n} model ekle.
- Bunlardan birinde AI Başlatma'ya basın — plan, modeli barındıran cihaz için yapılır ve hiçbir şey indirilmez.
Bir modeli cihaza indirin (5 dakika)
LLM Modelleri → İndir, herhangi bir satırda: cihazı, kayıtlı dizini ve nicemlemeyi seçin, depo kapılıysa bir token ekleyin ve indirmeyi cihaza bırakın.
Düzgün biçimde sunun (10 dakika)
LLM Başlatıcı → Servis Katmanı: bir LiteLLM gateway'i kurun, çalışan modelinizi içine kaydedin ve istemcilerinize master key vermek yerine kapsamlı virtual key'ler verin.
Daha ileri gidin (15–30 dakika)
- NVIDIA AI Dynamo — toplu ve ayrıştırılmış modlar, yönlendiriciler, KV konnektörleri ve sürükle-bırak GPU hattı. → NVIDIA AI Dynamo
- NVIDIA VSS — her servisi yeni, var olan ya da uzak olabilen beş servisli bir video hattı. → NVIDIA VSS
- Sparkrun — bir DGX Spark cluster'ında çok düğümlü çıkarım. → Sparkrun Cluster'ları
- Jetson AI Lab — NVIDIA'nın kataloğu, tek adımda bir Jetson'da başlatılır. → Jetson AI Lab
Elinizdekileri yönetin (5 dakika)
Konteynerleri tek tek ya da grup hâlinde başlatıp durdurun, bir varyant denemek için birini çoğaltın, genel URL'ler üretin, API kullanım örneklerini okuyun ve artık ihtiyacınız olmayanı silin.
Sorun giderme
Başlat düğmesi pasif İncele ve başlat'ı açın. Her engelleyici orada listelenir ve her biri sizi onu düzelten bölmeye götüren bir düğmedir. En yaygın olanlar "GPU seçilmedi" ve "model seçilmedi"dir.
Konteyner başlamıyor
- Cihaz hâlâ Çevrimiçi mi?
- İmaj için disk alanı var mı?
- Konteynerin Loglar sekmesini okuyun — hata neredeyse her zaman oradadır.
VRAM yetersiz
- VRAM Hesaplayıcı'da Aktivasyon Dahil ile kontrol edin.
- Nicemlemeyi düşürün (BF16 → FP8 → INT4), dizi uzunluğunu kısaltın, batch boyutunu azaltın ya da GPU ekleyin.
- Sihirbazın uyum danışmanı bunu daha başlamadan uyarır: "sığıyor ama kıl payı", KV önbelleği için az yer kaldığı anlamına gelir.
Model bulunamadı
- Özel model: repo kimliğini huggingface.co'da göründüğü gibi tam olarak yazdığınızı kontrol edin.
- Kullanıcı Modelleri: model yollarının hedef cihazda da kayıtlı olduğunu kontrol edin.
- Konteyner geçersiz kılma sekmesindeki volume eşlemesini kontrol edin.
Kapılı model / 401 LLM Modelleri'ndeki satır token gerekip gerekmediğini söyler. Kasanızdan bir token ekleyin ya da Ortam geçersiz kılma sekmesine yapıştırın.
Open WebUI hiç model göstermiyor
- Motor konteyneri gerçekten çalışıyor mu?
- Bir gateway'e yönlendirilmişse model gateway'e kaydedildi mi? Servis Katmanı → Sunulan'ı kontrol edin.
AI Başlatma "Modelin dosyaları cihazda okunamadı" diyor O cihazdaki kayıtlı model yolu okunamıyor. Yolu düzeltin; plan Hugging Face'e geri döndü ve aksi hâlde ağırlıkları yeniden indirecek.
Hızlı başvuru
Uygulama türleri
| Tür | Kullanım senaryosu | Karmaşıklık | Kurulum süresi |
|---|---|---|---|
| AI Başlatma | Sizin için planlanan herhangi bir Hugging Face modeli | En düşük | 2 dk |
| Standart uygulamalar | Temel konteynerler | Düşük | 5 dk |
| LLM motorları | Tam denetimle model çıkarımı | Orta | 5 dk |
| NVIDIA Dynamo | Dağıtık çoklu GPU | Yüksek | 10 dk |
| NVIDIA VSS | Video analiz hattı | Yüksek | 15 dk |
| Sparkrun | Çok düğümlü DGX Spark | Yüksek | 20 dk (artı cluster kurulumu) |
Kabaca GPU bellek rehberi
| Model boyutu | Nicemleme | Asgari VRAM | Tipik GPU |
|---|---|---|---|
| 7–8B | INT4 | 4–6 GB | RTX 3090, RTX 4090 |
| 7–8B | INT8 | 8–10 GB | RTX 4090, A10 |
| 13B | INT4 | 8–10 GB | RTX 4090, A10 |
| 13B | INT8 | 14–16 GB | A10, A100 40GB |
| 70B | INT4 | 40–50 GB | A100 80GB, 2× A100 40GB |
| 70B | INT8 | 80–90 GB | A100 80GB, 2× A100 80GB |
Bunlar yalnızca ağırlıklardır. Sunmayı düşündüğünüz bağlam uzunluğu ve batch boyutu için KV önbelleğini ekleyin — VRAM Hesaplayıcı tam da bunun içindir.
Neyin nerede olduğu
| Şunu yapmak istiyorum… | Buraya gidin |
|---|---|
| Uygulamalara göz atmak ve başlatmak | LLM Başlatıcı → Uygulamalar |
| Neyin çalıştığını görmek | LLM Başlatıcı → Konteynerler |
| Model bulmak ya da indirmek | LLM Başlatıcı → LLM Modelleri |
| Cihazda zaten duran bir modeli kullanmak | LLM Modelleri → Kullanıcı Modelleri |
| Gateway ya da sohbet arayüzünü tek başına çalıştırmak | LLM Başlatıcı → Servis Katmanı |
| Çok düğümlü çıkarım kurmak | LLM Başlatıcı → Sparkrun Cluster'ları |
| Bir Jetson AI Lab modeli çalıştırmak | LLM Başlatıcı → Jetson AI Lab |
| Bir modelin sığıp sığmadığını kontrol etmek | LLM Başlatıcı → VRAM Hesaplayıcı |
| Kendi imajınızı yüklemek | LLM Başlatıcı → Özel Registry |
| Model yollarını kaydetmek | Cihazlar → cihaz → Modeller |