Ana içeriğe geç

Başlatma Rehberi

Bu rehber, tam başlatma sihirbazını anlatır: imajı, GPU'ları, bayrakları ve servis katmanını kendiniz seçmek istediğinizde izlediğiniz yol. Kararı Cordatus'a bırakmayı tercih ederseniz AI Başlatma'yı kullanın — ve bir AI Başlatma planından Gelişmiş'te düzenle ile istediğiniz anda bu sihirbaza geçebileceğinizi unutmayın.

Uygulamalar kataloğundan çalışan motora, gateway'e ve sohbet arayüzüne

 


1. Uygulamayı bulun

LLM Başlatıcı → Uygulamalar, kullanıma hazır her uygulamayı listeler. Sayfa şunları sunar:

  • Alt başlıkta Ara.
  • Cihaz türüne göre filtreleSunucu - İş İstasyonu, Jetson, DGX Spark.
  • Jetson için ek bir Jetson grubu seçin… filtresi; böylece yalnızca kendi Jetson gruplarınızın çalıştırabileceklerini görürsünüz.
  • Başlığın altında her biri kaldırılabilir etkin filtre çipleri ve Tümünü Temizle.
  • Uygulama adını, yayıncı logosunu, kısa bir açıklamayı ve en fazla üç etiketi gösteren kartlar (gerisi +{n} more arkasında). Bir etikete tıklamak ona göre filtreler.
  • Daha Fazla Uygulama Yükle ya da alta yaklaştıkça sonsuz kaydırma.

Uygulamayı açmak için karta veya alt kısmındaki Detayları Görüntüle'ye tıklayın.

Arama, sonra etikete göre filtreleme — çipler neyin etkin olduğunu gösterir

 


2. Uygulama detay sayfası

Başlık; adı, tür etiketini, açıklamayı, etiketleri ve iki uyumluluk rozetini gösterir: Sunucu-İş İstasyonu (x86_64) ve Jetson (arm64); destekleniyorsa yeşil, desteklenmiyorsa kırmızı.

Sağda iki aksiyon vardır:

  • Tek Cihazda Uygulama Başlat (ya da Tek Cihazda Ortam Başlat) — aşağıda anlatılan sihirbaz.
  • Sparkrun'ı Başlat — yalnızca destekleyen motorlarda, çok düğümlü DGX Spark çalıştırmaları için. Bkz. Sparkrun Cluster'ları.

Dört sekme:

README / Açıklama

Uygulamanın README'si; yanında şunları içeren bir kenar çubuğu:

  • Genel bakış — kategori, en son sürüm, sürüm sayısı.
  • Cihaz uyumluluğu — aynı iki rozet, her birinin yanında mimarisi.
  • Uygun cihazlar — bunu çalıştırabilecek her cihazınız, çevrimiçi/çevrimdışı noktasıyla ve altta bir Başlat düğmesiyle.

Sürümler

Her imaj sürümünün sıralanabilir, sayfalanmış bir tablosu:

KolonAnlamı
Etiketİmaj etiketi.
BoyutSürümün tek varyantı varsa sıkıştırılmamış boyut.
OluşturulduYayımlanma tarihi.
Gereken Sürüm(ler)Asgari NVIDIA sürücü sürümü ya da üzerine gelince listelenen bir Jetpacks ({n} Version(s)) rozeti.
CihazlarSunucu - İş İstasyonu ya da Jetson ({n} Group(s)) — hangi gruplar olduğunu görmek için üzerine gelin.

Birden fazla donanım varyantı olan sürümler bir genişletme okuyla tek satıra toplanır; açıldığında her varyant kendi boyutu, tarihi, sürücü gereksinimi ve cihaz listesiyle görünür.

Arama kutusunun yanındaki Kolonları Özelleştir, bu kolonları göstermenizi, gizlemenizi ve sürükleyerek yeniden sıralamanızı sağlar. Seçiminiz hatırlanır.

Konteynerler

Bu uygulamadan başlattığınız her şey; ana Konteynerler sayfasıyla aynı iki sekmeli düzende: Konteynerler ve Sparkrun İş Yükleri.

Modeller

Yalnızca motor uygulamaları için: bu motorun sunabileceği modellere göre filtrelenmiş katalog ve sizi doğrudan model önceden seçilmiş hâlde sihirbaza bırakan bir Dağıt düğmesi.


3. Adım 1 — Cihaz Seç

Sihirbaz üç adımlı bir akordeon olarak açılır. Her adımın başlığı ne seçtiğinizi göstermeye devam eder, böylece açık olanın üzerindeki kararlar okunabilir kalır.

Dağıtım yapılacak cihazı seçin. Yalnızca bağlı cihazlar seçilebilir; alt bilgi {device} cihazına dağıtılıyor diye onaylar.

Bağlı bir cihaz seçilene kadar İleri pasif kalır.


4. Adım 2 — Sürüm Seç

Sürüm listesi, seçtiğiniz cihazın gerçekten çalıştırabileceklerine göre filtrelenir. Uyumluluk katı biçimde denetlenir: daha yeni bir JetPack için üretilmiş bir imaj hiçbir zaman daha eski bir cihaza sunulmaz.

Her sürüm şunları gösterir:

  • İndirildi — zaten cihazda, başlatma anında olur.
  • İndirilecek — başlatmada cihaza çekilir.
  • Uyumsuz — nedeniyle birlikte, örneğin "Sürücü sürümü uyuşmuyor — cihazınız: X, gereken: Y".

Ayrıca bir arama kutusu, bir İmaj özelliklerine göre filtrele kontrolü ve bir yenileme düğmesi vardır.

Hiçbir şey eşleşmezse liste, başarısız olacak imajları göstermek yerine "Cihazınız için uyumlu sürüm bulunamadı" der.

not

Özel Registry'den başlatırken sürüm adımı yoktur — başladığınız etiket sürümün kendisidir. Sihirbaz cihazdan doğrudan gelişmiş yapılandırmaya geçer.


5. Adım 3 — Gelişmiş Yapılandırma

Yeniden tasarımın en görünür olduğu yer burasıdır. Uzun bir panel listesi yerine adım, bir dikey raytır: karar başına bir kayıt, her biri mevcut cevabı özetleyen bir alt başlıkla ve tamamlanıp tamamlanmadığını gösteren bir işaretle.

Kurulum
● Model Qwen/Qwen3-8B ✓
● İşlem GPU'lar · bellek · CPU ✓
● Erişim sohbet arayüzü · gateway ✓
● Geçersiz Kılmalar 3 seçenek · not defteri açık ✎
● İncele ve başlat komut · konteynerler ›

Başlatmaya hazır
✓ GPU seçildi
✓ Model seçildi
✓ Yapılandırma geçerli

Başlatmaya hazır kartı, kapıyı tuttuğu düğmenin yanında, rayın dibine sabitlenmiştir. Bir şey eksikse onu adıyla söyler.

Profiller

Rayın üstünde dört hazır ayar:

ProfilEtkisi
Hızlı başlangıçYalnızca sohbet arayüzü.
API sunGateway + sohbet arayüzü.
Yalnızca gatewayGateway ve anahtarlar, sohbet arayüzü yok.
Yalnızca motorEk servis yok.

Bir profil yalnızca Erişim bölümünü doldurur. Model, GPU ya da geçersiz kılma seçimlerinize hiçbir zaman dokunmaz.


5.1 Model

Motor uygulamaları için ilk bölme. İki kaynak kartı:

  • Model merkezi — katalog (motora göre Hugging Face / Ollama / NVIDIA NIM).
  • Kullanıcı Modelleri — bu cihazda hâlihazırda duran modeller. Bkz. Kullanıcı Modelleri.
  • Özel — kendinizin yapıştırdığı bir ad ya da URL.

GPU uyum danışmanı

Kataloğun üstünde, seçili modeli cihazın GPU'larına göre okuyan tek bir satır:

  • "Önce bir model seçin — bu panel o zaman kaç GPU gerektiğini söyler."
  • "{model} seçiminize rahatça sığıyor."
  • "{model} sığıyor ama kıl payı." — KV önbelleği için az yer kalır, bu yüzden uzun bir bağlam ya da çok sayıda eşzamanlı istek başarısız olabilir.
  • "Seçiminiz yeterli değil — {model} en az {n} GPU gerektiriyor."
  • "{model} bu cihaza sığmıyor." — yalnızca ağırlıklar bile tüm GPU'ları birlikte doldurur.

Ayrıca cihazın GPU'ları farklı miktarda VRAM bildirdiğinde uyarır; çünkü tensor paralelliği eşit böler ve en küçük kart neyin sığacağını belirler.

not

Tahmin yalnızca ağırlık boyutundan yapılır. Seçtiğiniz bağlam uzunluğunun da yanına sığması gerekir — marj önemliyse VRAM Hesaplayıcı'yı kullanın.

Katalog

Her satır etiketi, Nicemleme, Boyut ve bir rozet gösterir:

  • Cihazda — ağırlıklar zaten orada.
  • İndirilecek — başlatmada çekilecek.
  • Seçime sığdır — seçtiğiniz GPU'lara sığıyor.

Arayabilir, sıralayabilir ve sığan modellerle Tüm modeller arasında geçiş yapabilirsiniz. Birden fazla nicemlemesi olan bir model seçtiğinizde satır açılır ve başlatılacak nicemlemeyi seçmenizi ister.

Model aktarımı

Kullanıcı Modelleri'den başka bir cihazda duran bir model seçerseniz Cordatus aktarım önerir:

  • Model Aktarımı Gerekli — normal durum; model boyutunu ve kaynak yolunu gösterir.
  • Model Aktarımını Sürdür — önceki bir deneme yarım kalmış; ne kadarının hazır olduğunu ve kaç dosyanın eksik ya da yarım olduğunu gösterir.
  • Bozuk Dosyalar Bulundu — sağlama doğrulaması başarısız oldu ve etkilenen dosyalar yeniden indirilecek.

İlerleme dosya bazındadır; toplam bayt ve dosya sayılarıyla birlikte. Yalnızca API Kullan, model bunun yerine bir API üzerinden erişilebilir olduğunda aktarımı atlar.


5.2 İşlem

GPU'lar

Cihazdaki her GPU bir kart olarak, BOŞ VRAM, KULLANIM ve SICAKLIK değerleriyle gösterilir. Tek tek GPU seçin ya da Tümünü kullan'ı açın. Başlatmaya izin verilmeden önce en az bir GPU seçilmiş olmalıdır.

Ana makine sınırları

Konteyner için CPU ve bellek sınırları:

  • Otomatik — varsayılan. Ana makineyi başka iş planlamak için serbest bırakır: konteyner kullanılabilir miktarla sınırlanır, Host Reserved CPU ve RAM sistem için ayrılır.
  • ÖzelCPU sınırı ve Bellek sınırı'nı gösterilen alt sınır ile kullanılabilir üst sınır arasında elle belirleyin.
  • Bir sınırı tamamen kapatmak da mümkündür ve kartta açıkça yazar: "CPU sınırı yok — konteyner {n} çekirdeğin tümünü kullanabilir."
ipucu

Aksi için bir nedeniniz yoksa Host Reserved değerlerini koruyun. Ağır bir motorun cihazın kendi ajanını aç bırakmasını engelleyen şey odur.


5.3 Erişim

Yalnızca uygulama bir servis katmanını desteklediğinde bulunur. Her biri bir anahtar olan iki kart:

  • Sohbet arayüzü — Open WebUI, sizin için oluşturulmuş bir yönetici hesabıyla.
  • API gateway — LiteLLM: anahtarları, kotaları ve istek loglarıyla tek bir OpenAI uyumlu uç nokta.

İkisi de kapalıyken yalnızca motorun kendi portu yayımlanır.

Hangi gateway?

Cihazda zaten bir LiteLLM gateway'i çalışıyorsa Cordatus onu bulur ve yeniden kullanmayı önerir — model onun içine kaydedilir ve yeni kimlik bilgisi gerekmez. Yine de Bunun yerine yeni bir gateway kur diyebilirsiniz; bu, kendi PostgreSQL, Redis ve Prometheus konteynerlerini ayağa kaldırır ve ilk açılışta veritabanı migration'larını çalıştırır (birkaç dakika).

Seçicinin dürüstçe bildirdiği özel durumlar:

  • birden fazla gateway çalışıyorsa → modelin hangisine kaydedileceğini siz seçersiniz;
  • master key'i ortamında olmayan bir gateway → Cordatus içine kayıt yapamaz, bu yüzden yeni bir tane kurulur;
  • cihaz sorgulanamadıysa → çalışan bir gateway yoksa yeni bir tane kurulur.

Kimlik bilgileri

Bu dağıtımın verdiği her sırrı içeren tek bir kart — Open WebUI yönetici adresi ve şifresi, LiteLLM master key'i, istemcilerin göndereceği model adı — her biri Göster, Kopyala ve bir Tümünü yeniden üret aksiyonuyla.

uyarı

Bunlar ortam başladıktan hemen sonra bir kez gösterilir. Cordatus bunları saklamaz. Adresler daha sonra her konteynerin Portlar sekmesinde görünür.

Hesaplar ve anahtarlar

  • Open WebUI hesapları — Open WebUI açıldıktan sonra oluşturulan ek hesaplar; böylece insanlar yönetici hesabını paylaşmak yerine kendi e-postalarıyla giriş yapar.
  • LiteLLM virtual key'leri — gateway ayağa kalktığında oluşturulur; her birinin bir adı, isteğe bağlı bir bütçesi ve isteğe bağlı bir yalnızca bu model kapsamı vardır. Bunları master key yerine dağıtın.

Gelişmiş erişim seçenekleri

Varsayılan olarak kapalı:

  • İstemcilerin gönderdiği model adı — genel takma ad. Bunu gerçek ağırlıklardan ayrı tutmak, istemcileri kırmadan ileride ağırlıkları değiştirmenizi sağlar.
  • LiteLLM ve Open WebUI için İmaj sürümleri — önce sabitlenmiş sürümler, sonra ön sürümler, sonra içeriği altınızdan değişen rc, dev ve main-stable gibi hareketli etiketler.
  • Open WebUI'yi şuraya bağla:LiteLLM gateway (böylece gateway'in sunduğu her modeli görür) ya da doğrudan Motor.
  • Open WebUI ve/veya gateway için Genel URL oluştur.

5.4 Geçersiz Kılmalar

Her biri canlı bir sayaç gösteren dört sekmeli tek bir kart:

Sekmeİçeriği
Konteynerdocker run seçenekleri — portlar, volume'lar, ağ, yeniden başlatma politikası, cihazlar.
OrtamToken kasanızdan gelenler dâhil ortam değişkenleri.
Motor bayraklarıBu imaja özgü motor argümanları.
Not defteriİmaj destekliyorsa Jupyter ayarları.

Bir açıklama, hangi satırları değiştirebileceğinizi söyler: ✎ düzenleyebilirsiniz ve 🔒 uygulama tarafından sabit. Uygulamanın sabitlediği hiçbir şey kaldırılamaz.

Portlar ve volume'lar

Portlar ana makinede neyin boş olduğunu gösterir ve bir port zaten kullanımda olduğunda uyarır. Volume'lar, cihazın gerçek dosya sistemini okuyan bir ana makine klasörü gezgini ile seçilir.

uyarı

Ana makine klasörleri konteynere olduğu gibi açılır. Neyi bağladığınızı bildiğinizden emin olun.

Token'lar

Ortam değişkenleri değerini token kasanızdan alabilir — Bir belirteç seçin ya da satır içinde Yeni bir belirteç ekle; bu onu saklar ve diğer ortamlarda yeniden kullanılabilir kılar. Buna ihtiyaç duymanın olağan nedeni kapılı Llama depolarıdır.

AI ile öner

AI ile öner, modeli seçili donanıma göre okuyan bir çözümleyiciden Konteyner, Ortam ve Motor bayrakları sekmelerini aynı anda doldurur. Raporu, üçünü birden yeniden yazdığı için tek bir sekmenin içinde değil, sekmelerin üstünde görünür:

  • "Model seçili donanıma sığmayacak."
  • "Donanımınıza sığdırmak için yapılan ayarlamalar:" ve ardından her ayarlama.
  • Yapılandırma ilgili bir modelden türetildiğinde "Şuradan çıkarıldı: {temel model}".
  • Öngörüler — donanım önerileri ve niteliksel gözlemler, tek bir listede.

Yeniden basmak bunu kapatır ve statik varsayılanları geri getirir.

Not defteri

Mevcut olduğunda Jupyter aynı konteynerin içinde çalışır, bu yüzden not defterleri modeli, bağlı klasörleri ve GPU'ları paylaşır. Koruma ya bir Erişim belirteci (sizin için üretilir, tarayıcı başına bir kez sorulur) ya da bir Şifredir.

uyarı

Korunmayan bir not defteri, ana makineye o porttan erişebilen herkese kabuk yetkili bir not defteri verir. Yalnızca yalıtılmış bir ağda kullanın.


5.5 İncele ve başlat

Hiçbir şey çalışmadan önceki son bölme:

  • Özet — her karar bir etiket/değer satırı olarak; her birinde onu sahiplenen bölmeye atlayan bir kalem simgesi. Ayarlanmamış her şey ayarlanmadı olarak görünür.
  • Oluşan komut — cihaza gönderilen aynı seçenekler, değişkenler ve argümanlardan kurulmuş gerçek komut. Kopyala onu panonuza alır.
  • Oluşturulacak konteynerler — servis katmanının beraberinde getirdikleri dâhil tam liste.
  • Engelleyiciler — eksik bir şey varsa önce o listelenir ve her kayıt sizi onu düzelten bölmeye götüren bir düğmedir.

6. Başlatma

Alt bilgi kararı, yönettiği düğmenin yanında taşır: dağıtım yaptığınız cihaz, bir hazırlık etiketi ve şunlar:

DüğmeNe zaman
Geri / İleriÜç adım arasında geçiş.
İncele ve başlatRay yolunda sizi İnceleme bölmesine götürür.
Ortamı BaşlatDağıtımı başlatır. Bir engelleyici varken pasiftir.
İptalSihirbazı kapatır.

Başlattıktan sonra:

  1. Cordatus işlemi cihazda yetkilendirir.
  2. İmaj yoksa çekilir — konteynerin İndiriliyor durumu olarak görünür.
  3. Konteynerler Konteynerler sayfasında gruplanmış olarak belirir.
  4. Bir servis katmanı yapılandırıldıysa Servis katmanı kimlik bilgilerinizi kaydedin diyalogu çıkar. Bunları kopyalayın; bir kez gösterilirler.

Çok bileşenli uygulamalar

İki uygulama aynı rayı farklı bir bölme kümesiyle kullanır:

  • NVIDIA AI Dynamo — Model, Çalışma zamanı, GPU hattı, Erişim, Geçersiz Kılmalar, İşçi argümanları, İnceleme. → NVIDIA AI Dynamo Rehberi
  • NVIDIA VSS — hattaki her servis için numaralı bir ray kaydı, ardından İnceleme. → NVIDIA VSS Rehberi

Docker Compose tabanlı uygulamalar bunun yerine Compose servisleri / Compose profilleri / Yapılandırma değişkenleri düzeni alır; seçili profillerdeki servisler ortamla birlikte başlar ve birincil servis her zaman çalışır.