Başlatma Rehberi
Bu rehber, tam başlatma sihirbazını anlatır: imajı, GPU'ları, bayrakları ve servis katmanını kendiniz seçmek istediğinizde izlediğiniz yol. Kararı Cordatus'a bırakmayı tercih ederseniz AI Başlatma'yı kullanın — ve bir AI Başlatma planından Gelişmiş'te düzenle ile istediğiniz anda bu sihirbaza geçebileceğinizi unutmayın.
1. Uygulamayı bulun
LLM Başlatıcı → Uygulamalar, kullanıma hazır her uygulamayı listeler. Sayfa şunları sunar:
- Alt başlıkta Ara.
- Cihaz türüne göre filtrele — Sunucu - İş İstasyonu, Jetson, DGX Spark.
- Jetson için ek bir Jetson grubu seçin… filtresi; böylece yalnızca kendi Jetson gruplarınızın çalıştırabileceklerini görürsünüz.
- Başlığın altında her biri kaldırılabilir etkin filtre çipleri ve Tümünü Temizle.
- Uygulama adını, yayıncı logosunu, kısa bir açıklamayı ve en fazla üç etiketi gösteren kartlar (gerisi +{n} more arkasında). Bir etikete tıklamak ona göre filtreler.
- Daha Fazla Uygulama Yükle ya da alta yaklaştıkça sonsuz kaydırma.
Uygulamayı açmak için karta veya alt kısmındaki Detayları Görüntüle'ye tıklayın.
2. Uygulama detay sayfası
Başlık; adı, tür etiketini, açıklamayı, etiketleri ve iki uyumluluk rozetini gösterir:
Sunucu-İş İstasyonu (x86_64) ve Jetson (arm64); destekleniyorsa yeşil, desteklenmiyorsa
kırmızı.
Sağda iki aksiyon vardır:
- Tek Cihazda Uygulama Başlat (ya da Tek Cihazda Ortam Başlat) — aşağıda anlatılan sihirbaz.
- Sparkrun'ı Başlat — yalnızca destekleyen motorlarda, çok düğümlü DGX Spark çalıştırmaları için. Bkz. Sparkrun Cluster'ları.
Dört sekme:
README / Açıklama
Uygulamanın README'si; yanında şunları içeren bir kenar çubuğu:
- Genel bakış — kategori, en son sürüm, sürüm sayısı.
- Cihaz uyumluluğu — aynı iki rozet, her birinin yanında mimarisi.
- Uygun cihazlar — bunu çalıştırabilecek her cihazınız, çevrimiçi/çevrimdışı noktasıyla ve altta bir Başlat düğmesiyle.
Sürümler
Her imaj sürümünün sıralanabilir, sayfalanmış bir tablosu:
| Kolon | Anlamı |
|---|---|
| Etiket | İmaj etiketi. |
| Boyut | Sürümün tek varyantı varsa sıkıştırılmamış boyut. |
| Oluşturuldu | Yayımlanma tarihi. |
| Gereken Sürüm(ler) | Asgari NVIDIA sürücü sürümü ya da üzerine gelince listelenen bir Jetpacks ({n} Version(s)) rozeti. |
| Cihazlar | Sunucu - İş İstasyonu ya da Jetson ({n} Group(s)) — hangi gruplar olduğunu görmek için üzerine gelin. |
Birden fazla donanım varyantı olan sürümler bir genişletme okuyla tek satıra toplanır; açıldığında her varyant kendi boyutu, tarihi, sürücü gereksinimi ve cihaz listesiyle görünür.
Arama kutusunun yanındaki Kolonları Özelleştir, bu kolonları göstermenizi, gizlemenizi ve sürükleyerek yeniden sıralamanızı sağlar. Seçiminiz hatırlanır.
Konteynerler
Bu uygulamadan başlattığınız her şey; ana Konteynerler sayfasıyla aynı iki sekmeli düzende: Konteynerler ve Sparkrun İş Yükleri.
Modeller
Yalnızca motor uygulamaları için: bu motorun sunabileceği modellere göre filtrelenmiş katalog ve sizi doğrudan model önceden seçilmiş hâlde sihirbaza bırakan bir Dağıt düğmesi.
3. Adım 1 — Cihaz Seç
Sihirbaz üç adımlı bir akordeon olarak açılır. Her adımın başlığı ne seçtiğinizi göstermeye devam eder, böylece açık olanın üzerindeki kararlar okunabilir kalır.
Dağıtım yapılacak cihazı seçin. Yalnızca bağlı cihazlar seçilebilir; alt bilgi {device} cihazına dağıtılıyor diye onaylar.
Bağlı bir cihaz seçilene kadar İleri pasif kalır.
4. Adım 2 — Sürüm Seç
Sürüm listesi, seçtiğiniz cihazın gerçekten çalıştırabileceklerine göre filtrelenir. Uyumluluk katı biçimde denetlenir: daha yeni bir JetPack için üretilmiş bir imaj hiçbir zaman daha eski bir cihaza sunulmaz.
Her sürüm şunları gösterir:
- İndirildi — zaten cihazda, başlatma anında olur.
- İndirilecek — başlatmada cihaza çekilir.
- Uyumsuz — nedeniyle birlikte, örneğin "Sürücü sürümü uyuşmuyor — cihazınız: X, gereken: Y".
Ayrıca bir arama kutusu, bir İmaj özelliklerine göre filtrele kontrolü ve bir yenileme düğmesi vardır.
Hiçbir şey eşleşmezse liste, başarısız olacak imajları göstermek yerine "Cihazınız için uyumlu sürüm bulunamadı" der.
Özel Registry'den başlatırken sürüm adımı yoktur — başladığınız etiket sürümün kendisidir. Sihirbaz cihazdan doğrudan gelişmiş yapılandırmaya geçer.
5. Adım 3 — Gelişmiş Yapılandırma
Yeniden tasarımın en görünür olduğu yer burasıdır. Uzun bir panel listesi yerine adım, bir dikey raytır: karar başına bir kayıt, her biri mevcut cevabı özetleyen bir alt başlıkla ve tamamlanıp tamamlanmadığını gösteren bir işaretle.
Kurulum
● Model Qwen/Qwen3-8B ✓
● İşlem GPU'lar · bellek · CPU ✓
● Erişim sohbet arayüzü · gateway ✓
● Geçersiz Kılmalar 3 seçenek · not defteri açık ✎
● İncele ve başlat komut · konteynerler ›
Başlatmaya hazır
✓ GPU seçildi
✓ Model seçildi
✓ Yapılandırma geçerli
Başlatmaya hazır kartı, kapıyı tuttuğu düğmenin yanında, rayın dibine sabitlenmiştir. Bir şey eksikse onu adıyla söyler.
Profiller
Rayın üstünde dört hazır ayar:
| Profil | Etkisi |
|---|---|
| Hızlı başlangıç | Yalnızca sohbet arayüzü. |
| API sun | Gateway + sohbet arayüzü. |
| Yalnızca gateway | Gateway ve anahtarlar, sohbet arayüzü yok. |
| Yalnızca motor | Ek servis yok. |
Bir profil yalnızca Erişim bölümünü doldurur. Model, GPU ya da geçersiz kılma seçimlerinize hiçbir zaman dokunmaz.
5.1 Model
Motor uygulamaları için ilk bölme. İki kaynak kartı:
- Model merkezi — katalog (motora göre Hugging Face / Ollama / NVIDIA NIM).
- Kullanıcı Modelleri — bu cihazda hâlihazırda duran modeller. Bkz. Kullanıcı Modelleri.
- Özel — kendinizin yapıştırdığı bir ad ya da URL.
GPU uyum danışmanı
Kataloğun üstünde, seçili modeli cihazın GPU'larına göre okuyan tek bir satır:
- "Önce bir model seçin — bu panel o zaman kaç GPU gerektiğini söyler."
- "{model} seçiminize rahatça sığıyor."
- "{model} sığıyor ama kıl payı." — KV önbelleği için az yer kalır, bu yüzden uzun bir bağlam ya da çok sayıda eşzamanlı istek başarısız olabilir.
- "Seçiminiz yeterli değil — {model} en az {n} GPU gerektiriyor."
- "{model} bu cihaza sığmıyor." — yalnızca ağırlıklar bile tüm GPU'ları birlikte doldurur.
Ayrıca cihazın GPU'ları farklı miktarda VRAM bildirdiğinde uyarır; çünkü tensor paralelliği eşit böler ve en küçük kart neyin sığacağını belirler.
Tahmin yalnızca ağırlık boyutundan yapılır. Seçtiğiniz bağlam uzunluğunun da yanına sığması gerekir — marj önemliyse VRAM Hesaplayıcı'yı kullanın.
Katalog
Her satır etiketi, Nicemleme, Boyut ve bir rozet gösterir:
- Cihazda — ağırlıklar zaten orada.
- İndirilecek — başlatmada çekilecek.
- Seçime sığdır — seçtiğiniz GPU'lara sığıyor.
Arayabilir, sıralayabilir ve sığan modellerle Tüm modeller arasında geçiş yapabilirsiniz. Birden fazla nicemlemesi olan bir model seçtiğinizde satır açılır ve başlatılacak nicemlemeyi seçmenizi ister.
Model aktarımı
Kullanıcı Modelleri'den başka bir cihazda duran bir model seçerseniz Cordatus aktarım önerir:
- Model Aktarımı Gerekli — normal durum; model boyutunu ve kaynak yolunu gösterir.
- Model Aktarımını Sürdür — önceki bir deneme yarım kalmış; ne kadarının hazır olduğunu ve kaç dosyanın eksik ya da yarım olduğunu gösterir.
- Bozuk Dosyalar Bulundu — sağlama doğrulaması başarısız oldu ve etkilenen dosyalar yeniden indirilecek.
İlerleme dosya bazındadır; toplam bayt ve dosya sayılarıyla birlikte. Yalnızca API Kullan, model bunun yerine bir API üzerinden erişilebilir olduğunda aktarımı atlar.
5.2 İşlem
GPU'lar
Cihazdaki her GPU bir kart olarak, BOŞ VRAM, KULLANIM ve SICAKLIK değerleriyle gösterilir. Tek tek GPU seçin ya da Tümünü kullan'ı açın. Başlatmaya izin verilmeden önce en az bir GPU seçilmiş olmalıdır.
Ana makine sınırları
Konteyner için CPU ve bellek sınırları:
- Otomatik — varsayılan. Ana makineyi başka iş planlamak için serbest bırakır: konteyner kullanılabilir miktarla sınırlanır, Host Reserved CPU ve RAM sistem için ayrılır.
- Özel — CPU sınırı ve Bellek sınırı'nı gösterilen alt sınır ile kullanılabilir üst sınır arasında elle belirleyin.
- Bir sınırı tamamen kapatmak da mümkündür ve kartta açıkça yazar: "CPU sınırı yok — konteyner {n} çekirdeğin tümünü kullanabilir."
Aksi için bir nedeniniz yoksa Host Reserved değerlerini koruyun. Ağır bir motorun cihazın kendi ajanını aç bırakmasını engelleyen şey odur.
5.3 Erişim
Yalnızca uygulama bir servis katmanını desteklediğinde bulunur. Her biri bir anahtar olan iki kart:
- Sohbet arayüzü — Open WebUI, sizin için oluşturulmuş bir yönetici hesabıyla.
- API gateway — LiteLLM: anahtarları, kotaları ve istek loglarıyla tek bir OpenAI uyumlu uç nokta.
İkisi de kapalıyken yalnızca motorun kendi portu yayımlanır.
Hangi gateway?
Cihazda zaten bir LiteLLM gateway'i çalışıyorsa Cordatus onu bulur ve yeniden kullanmayı önerir — model onun içine kaydedilir ve yeni kimlik bilgisi gerekmez. Yine de Bunun yerine yeni bir gateway kur diyebilirsiniz; bu, kendi PostgreSQL, Redis ve Prometheus konteynerlerini ayağa kaldırır ve ilk açılışta veritabanı migration'larını çalıştırır (birkaç dakika).
Seçicinin dürüstçe bildirdiği özel durumlar:
- birden fazla gateway çalışıyorsa → modelin hangisine kaydedileceğini siz seçersiniz;
- master key'i ortamında olmayan bir gateway → Cordatus içine kayıt yapamaz, bu yüzden yeni bir tane kurulur;
- cihaz sorgulanamadıysa → çalışan bir gateway yoksa yeni bir tane kurulur.
Kimlik bilgileri
Bu dağıtımın verdiği her sırrı içeren tek bir kart — Open WebUI yönetici adresi ve şifresi, LiteLLM master key'i, istemcilerin göndereceği model adı — her biri Göster, Kopyala ve bir Tümünü yeniden üret aksiyonuyla.
Bunlar ortam başladıktan hemen sonra bir kez gösterilir. Cordatus bunları saklamaz. Adresler daha sonra her konteynerin Portlar sekmesinde görünür.
Hesaplar ve anahtarlar
- Open WebUI hesapları — Open WebUI açıldıktan sonra oluşturulan ek hesaplar; böylece insanlar yönetici hesabını paylaşmak yerine kendi e-postalarıyla giriş yapar.
- LiteLLM virtual key'leri — gateway ayağa kalktığında oluşturulur; her birinin bir adı, isteğe bağlı bir bütçesi ve isteğe bağlı bir yalnızca bu model kapsamı vardır. Bunları master key yerine dağıtın.
Gelişmiş erişim seçenekleri
Varsayılan olarak kapalı:
- İstemcilerin gönderdiği model adı — genel takma ad. Bunu gerçek ağırlıklardan ayrı tutmak, istemcileri kırmadan ileride ağırlıkları değiştirmenizi sağlar.
- LiteLLM ve Open WebUI için İmaj sürümleri — önce sabitlenmiş sürümler, sonra ön sürümler, sonra
içeriği altınızdan değişen
rc,devvemain-stablegibi hareketli etiketler. - Open WebUI'yi şuraya bağla: — LiteLLM gateway (böylece gateway'in sunduğu her modeli görür) ya da doğrudan Motor.
- Open WebUI ve/veya gateway için Genel URL oluştur.
5.4 Geçersiz Kılmalar
Her biri canlı bir sayaç gösteren dört sekmeli tek bir kart:
| Sekme | İçeriği |
|---|---|
| Konteyner | docker run seçenekleri — portlar, volume'lar, ağ, yeniden başlatma politikası, cihazlar. |
| Ortam | Token kasanızdan gelenler dâhil ortam değişkenleri. |
| Motor bayrakları | Bu imaja özgü motor argümanları. |
| Not defteri | İmaj destekliyorsa Jupyter ayarları. |
Bir açıklama, hangi satırları değiştirebileceğinizi söyler: ✎ düzenleyebilirsiniz ve 🔒 uygulama tarafından sabit. Uygulamanın sabitlediği hiçbir şey kaldırılamaz.
Portlar ve volume'lar
Portlar ana makinede neyin boş olduğunu gösterir ve bir port zaten kullanımda olduğunda uyarır. Volume'lar, cihazın gerçek dosya sistemini okuyan bir ana makine klasörü gezgini ile seçilir.
Ana makine klasörleri konteynere olduğu gibi açılır. Neyi bağladığınızı bildiğinizden emin olun.
Token'lar
Ortam değişkenleri değerini token kasanızdan alabilir — Bir belirteç seçin ya da satır içinde Yeni bir belirteç ekle; bu onu saklar ve diğer ortamlarda yeniden kullanılabilir kılar. Buna ihtiyaç duymanın olağan nedeni kapılı Llama depolarıdır.
AI ile öner
AI ile öner, modeli seçili donanıma göre okuyan bir çözümleyiciden Konteyner, Ortam ve Motor bayrakları sekmelerini aynı anda doldurur. Raporu, üçünü birden yeniden yazdığı için tek bir sekmenin içinde değil, sekmelerin üstünde görünür:
- "Model seçili donanıma sığmayacak."
- "Donanımınıza sığdırmak için yapılan ayarlamalar:" ve ardından her ayarlama.
- Yapılandırma ilgili bir modelden türetildiğinde "Şuradan çıkarıldı: {temel model}".
- Öngörüler — donanım önerileri ve niteliksel gözlemler, tek bir listede.
Yeniden basmak bunu kapatır ve statik varsayılanları geri getirir.
Not defteri
Mevcut olduğunda Jupyter aynı konteynerin içinde çalışır, bu yüzden not defterleri modeli, bağlı klasörleri ve GPU'ları paylaşır. Koruma ya bir Erişim belirteci (sizin için üretilir, tarayıcı başına bir kez sorulur) ya da bir Şifredir.
Korunmayan bir not defteri, ana makineye o porttan erişebilen herkese kabuk yetkili bir not defteri verir. Yalnızca yalıtılmış bir ağda kullanın.
5.5 İncele ve başlat
Hiçbir şey çalışmadan önceki son bölme:
- Özet — her karar bir etiket/değer satırı olarak; her birinde onu sahiplenen bölmeye atlayan bir kalem simgesi. Ayarlanmamış her şey ayarlanmadı olarak görünür.
- Oluşan komut — cihaza gönderilen aynı seçenekler, değişkenler ve argümanlardan kurulmuş gerçek komut. Kopyala onu panonuza alır.
- Oluşturulacak konteynerler — servis katmanının beraberinde getirdikleri dâhil tam liste.
- Engelleyiciler — eksik bir şey varsa önce o listelenir ve her kayıt sizi onu düzelten bölmeye götüren bir düğmedir.
6. Başlatma
Alt bilgi kararı, yönettiği düğmenin yanında taşır: dağıtım yaptığınız cihaz, bir hazırlık etiketi ve şunlar:
| Düğme | Ne zaman |
|---|---|
| Geri / İleri | Üç adım arasında geçiş. |
| İncele ve başlat | Ray yolunda sizi İnceleme bölmesine götürür. |
| Ortamı Başlat | Dağıtımı başlatır. Bir engelleyici varken pasiftir. |
| İptal | Sihirbazı kapatır. |
Başlattıktan sonra:
- Cordatus işlemi cihazda yetkilendirir.
- İmaj yoksa çekilir — konteynerin İndiriliyor durumu olarak görünür.
- Konteynerler Konteynerler sayfasında gruplanmış olarak belirir.
- Bir servis katmanı yapılandırıldıysa Servis katmanı kimlik bilgilerinizi kaydedin diyalogu çıkar. Bunları kopyalayın; bir kez gösterilirler.
Çok bileşenli uygulamalar
İki uygulama aynı rayı farklı bir bölme kümesiyle kullanır:
- NVIDIA AI Dynamo — Model, Çalışma zamanı, GPU hattı, Erişim, Geçersiz Kılmalar, İşçi argümanları, İnceleme. → NVIDIA AI Dynamo Rehberi
- NVIDIA VSS — hattaki her servis için numaralı bir ray kaydı, ardından İnceleme. → NVIDIA VSS Rehberi
Docker Compose tabanlı uygulamalar bunun yerine Compose servisleri / Compose profilleri / Yapılandırma değişkenleri düzeni alır; seçili profillerdeki servisler ortamla birlikte başlar ve birincil servis her zaman çalışır.