LLM Başlatıcı nedir?
LLM Başlatıcı, Cordatus'un bir modeli servise almak için kullandığınız bölümüdür. "Bu modeli çalıştırmak istiyorum" ile "işte uygulamamın çağırabileceği uç nokta" arasındaki her şeyi kapsar: modeli bulmak, cihaza indirmek, donanımı seçmek, motoru ve bayraklarını çıkarmak, konteynerleri başlatmak ve önlerine bir sohbet arayüzü ile bir API gateway koymak.
Daha önce adı Application Hub'dı. Menü grubu, içindeki sayfalar ve başlatma akışı baştan tasarlandı; bu bölüm mevcut arayüzü belgeler.
Kimin için?
- Elle
docker runsatırları ve motor bayrakları yazmadan hızlıca servis veren bir model isteyen yapay zekâ mühendisleri ve veri bilimciler. - Bir cihaz filosu üzerinde birkaç motor çalıştıran ve hepsini görebileceği, başlatıp durdurabileceği ve silebileceği tek bir yere ihtiyaç duyan ML platform / DevOps ekipleri.
- Nicemlemeleri, bağlam uzunluklarını ve motorları gerçekten sahip oldukları donanımda karşılaştıran araştırmacılar.
- Modelin, gateway'in ve sohbet arayüzünün kendi makinelerinde yaşaması gereken şirket içi (on-prem) ekipler.
Bu bölümdeki sayfalar
| Sayfa | Ne işe yarar |
|---|---|
| Konteynerler | Cihazlarınızda çalışan (ya da durmuş) her şey; gruplanmış hâlde, loglar, parametreler, portlar ve Sparkrun iş yükleriyle. → Konteynerler |
| Uygulamalar | Kullanıma hazır yapay zekâ uygulamaları kataloğu — vLLM, TensorRT-LLM, Ollama, NVIDIA Dynamo, NVIDIA VSS ve daha fazlası. → Başlatma Rehberi |
| Ortamlar | Çıkarım motorları değil, geliştirme ortamları (PyTorch, TensorFlow, CUDA, TensorRT…). → Ortamlar |
| Özel Registry | Kendi özel konteyner depolarınız ve etiketleriniz. → Özel Registry |
| LLM Modelleri | Model kataloğu: Hugging Face, Ollama, NVIDIA NIM ve kendi cihazlarınızda duran modeller. → LLM Modelleri |
| Sparkrun Cluster'ları | Çok düğümlü çıkarım için DGX Spark cluster'ları. → Sparkrun Cluster'ları |
| Servis Katmanı | Bir API gateway (LiteLLM) ve bir sohbet arayüzü (Open WebUI), tek başlarına yönetilir. → Servis Katmanı |
| Jetson AI Lab | NVIDIA'nın Jetson AI Lab kataloğu, Jetson cihazlarınızda tek adımda başlatılabilir. → Jetson AI Lab |
| VRAM Hesaplayıcı | Dağıtmadan önce bir modelin sığıp sığmadığını hesaplayın. → VRAM Hesaplayıcı |
LLM Başlatıcı ile neler yapabilirim?
-
Model bulun ve indirin
- Hugging Face, Ollama ve NVIDIA NIM'e tek bir katalogdan göz atın
- Gerçekten sahip olduğunuz GPU'lara ya da Jetson modülüne göre filtreleyin
- Ağırlıkları doğrudan bir cihaza, kayıtlı bir model dizinine indirin
- Cihazın hâlihazırda barındırdığı modelleri kaydedin ve cihazlar arasında aktarın
-
Yapay zekâ uygulamaları dağıtın
- vLLM, TensorRT-LLM, Ollama, llama.cpp ve diğer çıkarım motorları
- NVIDIA AI Dynamo (dağıtık LLM çalışma zamanı)
- NVIDIA VSS (Video Search & Summarization)
- Docker Compose uygulamaları ve kendi özel imajlarınız
-
Başlatmayı Cordatus planlasın
- AI Başlatma cihazlarınızı sıralar; motoru, imajı, GPU'ları, nicemlemeyi ve bayrakları seçer
- Her seçimin arkasındaki kanıt gösterilir ve engelleyiciler siz onaylamadan önce söylenir
-
Ya da her şeyi kendiniz yapılandırın
- GPU seçimi, ana makine CPU ve RAM sınırları
- Model kaynağı: model merkezi, kendi modelleriniz ya da özel bir ad/URL
- Konteyner seçenekleri, ortam değişkenleri, motor bayrakları, not defteri
- Çalışmadan önce gösterilen tam komut
-
Modeli istemcilere sunun
- Anahtarları, kotaları ve istek loglarıyla OpenAI uyumlu bir LiteLLM gateway'i
- Ek hesaplarıyla bir Open WebUI sohbet arayüzü
- Her ikisine ağ dışından erişmek için genel URL'ler
-
Herhangi bir şey dağıtmadan önce VRAM gereksinimlerini hesaplayın
-
Konteynerleri izleyin ve yönetin
- Canlı loglar, parametreler ve portlar
- Tek tek ya da grup hâlinde başlatın, durdurun, silin ve çoğaltın
- Genel URL'leri üretin, yeniden üretin ve kapatın
Başlatmanın iki yolu
Cordatus aynı sonuca giden iki yol sunar. İkisi de Konteynerler sayfasından yönettiğiniz çalışan konteynerlerle biter.
1. AI Başlatma — kararı sistem verir
Bir model seçersiniz. Cordatus cihazlarınızı sıralar, modelin yapılandırmasını okur, motoru, konteyner imajını, GPU'ları, nicemlemeyi ve bayrakları seçer ve her seçimin arkasındaki kanıtla birlikte planı, hiçbir şey başlamadan önce size gösterir.
Çalışan bir uç nokta isteyip bunun için on karar vermek istemediğinizde kullanın.
2. Başlatma sihirbazı — kararı siz verirsiniz
Üç adım (cihaz → sürüm → gelişmiş yapılandırma) ve üçüncü adımın içinde karar başına bir bölme taşıyan dikey bir ray: Model, İşlem, Erişim, Geçersiz Kılmalar ve son olarak çalışacak tam komutu ve oluşturulacak her konteyneri gösteren İncele ve başlat.
Belirli bir imaja, belirli bayraklara, belirli bir GPU dağılımına ya da Dynamo veya VSS gibi çok bileşenli bir dağıtıma ihtiyacınız olduğunda kullanın.
İkisi ayrı dünyalar değildir. Bir AI Başlatma planından Gelişmiş'te düzenle'ye basabilirsiniz; sihirbaz, planlayıcının bulduğu her şey önceden doldurulmuş hâlde açılır.
LLM Başlatıcı nasıl çalışır?
1. Bir model bulun (ya da doğrudan bir uygulamaya geçin)
LLM Modelleri'nden Hugging Face, Ollama, NVIDIA NIM ya da Kullanıcı Modelleri'e göz atın. Jetson modülünüze, sayısıyla birlikte bir GPU modeline ya da bağlı bir cihazın gerçek GPU'larını okuyarak (Cihazdan) filtreleyin. Her satır modelin açık mı olduğunu yoksa erişim belirteci mi gerektiğini söyler.
2. Bir cihaza indirin (isteğe bağlı)
Bir model satırındaki İndir, ağırlıkları tarayıcınız üzerinden değil cihaz üzerinde çeker:
- Cihaz — nereye konacağı.
- Dizin — o cihazda kayıtlı model dizinlerinden biri. Henüz hiçbiri kayıtlı değilse diyalog sizin için birini kaydeder; dizin yükseltilmiş yetki gerektirdiğinde root olarak neyin oluşturulacağını ve neyin oluşturulmayacağını tam olarak söyler.
- Nicemleme / Profil — bir depo aynı modeli birkaç biçimde yayımlıyorsa yalnızca seçtiğiniz artı paylaşılan dosyalar indirilir; ya da Tüm quantization'lar'ı seçin.
- Token — kayıtlı ya da yapıştırdığınız bir token; açık modeller için isteğe bağlı.
- sudo şifresi, yalnızca hedef dizin gerektirdiğinde. Cihazda kayıtlı bir şifre varsa onun yerine o kullanılır ve tarayıcınıza hiçbir zaman gönderilmez.
Cordatus genel bir hatayla başarısız olmak yerine dürüstçe bildirir: o cihazda hâlihazırda süren bir indirme, başka bir kullanıcıya ait bir dizin ya da okunamayan bir dosya listesi (bu durumda deponun tamamı çekilir).
3. Bir uygulama ve sürüm seçin
Uygulamalar'dan cihaz türüne göre filtreleyin (Sunucu-İş İstasyonu, Jetson, DGX Spark), birini açın ve Sürümler sekmesine bakın. Her sürüm boyutunu, tarihini, asgari sürücü ya da JetPack sürümünü ve hangi cihaz gruplarını desteklediğini gösterir — ve bir cihaz seçildiğinde İndirildi mi İndirilecek mi olduğunu.
4. Cihazı ve sürümü seçin
Sihirbazın ilk iki adımı. Uyumluluk katı biçimde denetlenir: daha yeni bir JetPack için üretilmiş bir imaj hiçbir zaman daha eski bir cihaza sunulmaz.
5. Yapılandırın
Üçüncü adım bir paneller yığını değil, bir raydır:
Model — model merkezi, Kullanıcı Modelleri ya da Özel; seçili GPU'ların modeli tutup tutamayacağını ve kaç GPU gerekeceğini söyleyen bir GPU uyum danışmanı ile. Ağırlıklar başka bir cihazdaysa model aktarımı otomatik olarak önerilir.
İşlem — hangi GPU'lar (ya da Tümünü kullan) ve CPU ile RAM için Ana makine sınırları. Otomatik, Host Reserved değerlerini sistem için ayırır; Özel, sınırları belirlemenizi sağlar.
Erişim — servis katmanı: bir Open WebUI sohbet arayüzü ve/veya bir LiteLLM gateway'i; kimlik bilgileri, virtual key'ler, ek hesaplar ve genel URL'lerle. Dört Profil (Hızlı başlangıç / API sun / Yalnızca gateway / Yalnızca motor) bu bölmeyi tek tıkla ayarlar ve başka hiçbir şeye dokunmaz.
Geçersiz Kılmalar — dört sekmeli tek bir kart:
- Konteyner — port eşlemeleri (boş/kullanımda uyarılarıyla) ve cihazın gerçek diskleri üzerinde çalışan bir dosya gezginiyle volume bağlamaları, ayrıca ağ, yeniden başlatma politikası ve cihazlar
- Ortam — token kasanızdan gelen değerler dâhil değişkenler
- Motor bayrakları — motora özgü argümanlar
- Not defteri — token ya da şifreyle korunan Jupyter
AI ile öner ilk üçünü aynı anda doldurur ve donanımınıza sığdırmak için neyi ayarladığını bildirir; ya da modelin sığmayacağını açıkça söyler.
İncele ve başlat — her satırın yanında bir kalem simgesi olan özet, oluşan komut ve servis katmanının beraberinde getirdikleri dâhil oluşturulacak konteynerlerin tam listesi.
6. Başlatın ve izleyin
Dağıtımı başlatın, imaj cihazda yoksa çekilmesini izleyin ve konteynerleri Konteynerler sayfasında — ya da uygulamanın kendi Konteynerler sekmesinde — teslim alın. Bir servis katmanı yapılandırıldıysa kimlik bilgilerini çıkan diyalogdan kopyalayın; bir kez gösterilirler.
7. Çalışanları yönetin
Gerçek zamanlı loglar, parametreler ve portlar; başlatma, durdurma, silme ve çoğaltma; genel URL'ler; çalışan bir motor için API kullanım örnekleri.
Uygulama türleri
Standart uygulamalar
GPU, CPU ve RAM yapılandırmasıyla basit konteynerler:
- tek konteyner dağıtımı
- doğrudan GPU ataması
- standart geçersiz kılma sekmeleri
LLM motor uygulamaları
Model yönetimiyle çıkarım motorları:
- model merkezinden, Kullanıcı Modelleri'den ya da özel bir ad/URL'den model seçimi
- motora göre otomatik volume yapılandırması
- sürdürme ve sağlama onarımıyla cihazlar arası model aktarımı
- GPU uyum danışmanı
- isteğe bağlı servis katmanı (sohbet arayüzü ve/veya gateway)
- çözümleyicinin doldurabildiği motora özgü argümanlar
→ Başlatma Rehberi · Kullanıcı Modelleri
NVIDIA AI Dynamo
Çoklu GPU dağıtımları için dağıtık LLM çalışma zamanı:
- işlem modları — Toplu / Ayrıştırılmış
- yönlendiriciler —
kv(KV skoruna duyarlı),round-robin,random - KV konnektörleri —
lmcache,kvbm,nixl,none; isteğe bağlı RAM/disk devretme boyutlarıyla - ön dolgu ve kod çözme işçilerine GPU atamak için sürükle-bırak bir GPU hattı
- tek bir frontend'in arkasında çok konteynerli orkestrasyon
NVIDIA VSS (Video Search & Summarization)
Beş servisli bir hat: VSS (isteğe bağlı Etkinlik İnceleyici ile), VLM, LLM, Embed ve Rerank. Her servis yeni bir konteyner, cihazda zaten çalışan bir konteyner ya da uzak bir OpenAI uyumlu uç nokta olabilir.
Sparkrun (çok düğümlü)
Tek bir cihazdaki Docker konteynerleri yerine bir DGX Spark cluster'ı üzerinde başlatılan tarifler.
Geliştirme ortamları
PyTorch, TensorFlow, CUDA, TensorRT ve diğerleri — aynı akış, model adımı yok, Jupyter aynı konteynerin içinde.
→ Ortamlar
Kendi imajlarınız
Özel Registry'ye yüklediğiniz her şey; isteğe bağlı olarak motor olarak işaretlenirse Cordatus onu motor olarak başlatabilir.
Cihazlarınızdaki modeller
Model yolu yapılandırması
Model yolları cihaz bazındadır; Cihazlar → cihaz → Modeller → Depolama Yolları altında bulunur:
- HuggingFace önbellek yolu
- Ollama modeller yolu
- NVIDIA NIM önbellek yolu
- Özel yollar
İndirilen Modeller ardından her yolun altında bulunanları, model başına bir Dağıt düğmesiyle listeler. Bir yolu kaldırmak onu yalnızca ayarlardan kaldırır — dosyalar silinmez.
Kütüphanenize model eklemek
- Cihazlarınızdaki Modelleri Keşfedin — Cordatus cihazdan HuggingFace, Ollama ve NIM dizinlerini ister ve her birini okur. Kütüphanenizde zaten olanlar Eklendi, diğerleri Yeni olarak işaretlenir; hedef motorları seçip içe aktarın. Yeniden tara, cihazın artık barındırmadığı her şeyi temizler.
- Elle model ekle — özel bir yoldaki model için: cihaz, yol, ad, tür, etiket ve motorlar.
Model aktarımı
- Aktarımlar kendi ağınızda cihazdan cihaza yapılır
- Yarım kalan aktarımlar sürdürülür; bozuk dosyalar sağlamayla tespit edilip yeniden indirilir
- İlerleme dosya bazında, toplamlarla birlikte gösterilir
- Yalnızca API Kullan, model bir API üzerinden erişilebilir olduğunda kopyalamayı atlar
- Tamamlandığında volume eşlemesi otomatik yapılandırılır
Bir kullanıcı modelini dağıtmak
AI Başlatma doğrudan modeli barındıran cihaz için plan yapar; Manuel → Şununla manuel çalıştır… sihirbazı model önceden seçilmiş ve doğru yollar eşlenmiş hâlde açar.
VRAM Hesaplayıcı
Dağıtmadan önce hesaplayın
- Bir model seçin — Hugging Face'te arayın; parametreler otomatik getirilir. GGUF depoları için yaklaşık ağırlık başına bit sayısıyla dosya bazlı bir nicemleme seçici gelir.
- GPU'yu seçin — katalogdan ya da Cihaz GPU'larını Seç ile cihazlarınızdan birinin gerçek GPU'larını okuyarak.
- Yapılandırın — GPU sayısı, nicemleme, dizi uzunluğu, batch boyutu, GPU bellek kullanımı ve hesaplama türü (%20 Ek Yük ya da Aktivasyon Dahil).
- Sonucu okuyun — Model Ağırlıkları / KV Önbelleği / Ek Yük ya da Etkinleştirmeler / Boş VRAM halka grafiği, ayrıntılı metrikler, bir kullanım çubuğu ve VRAM Yeterli / Yetersiz kararı.
Kullanım senaryoları
- GPU almadan önce donanım gereksinimlerini test etmek
- Sahip olduğunuz donanım için nicemleme, dizi uzunluğu ve batch boyutunu iyileştirmek
- Çoklu GPU dağıtımlarını planlamak
- Farklı model yapılandırmalarını yan yana karşılaştırmak
Konteyner yönetimi
İşlemler
- Başlat / Durdur — tek tek, alt konteyner bazında ya da tüm grup için
- Sil — onaylamak için
DELETEyazın; volume'lar önce listelenir ve atlanabilir - Çoğalt — bu konteynerin yapılandırmasıyla önceden doldurulmuş yeni bir başlatma
- Aç — büyük gruplar için arama kutusu olan grup paneli
Pasif aksiyonlar her zaman nedenini söyler: Konteyner(ler) zaten durdurulmuş, Cihaz bağlantısı kullanılamıyor, Çoğaltma izniniz yok.
Toplu işlemler
Satırları onay kutularıyla seçin ve Seçilenleri Sil'i kullanın. Grup aksiyonları gruptaki her konteynere uygulanır.
Konteyner bilgileri
- Loglar — canlı çıktı, Kopyala ile
- Parametreler — konteynerin oluşturulduğu her değer
- Portlar — yerel ve genel adresler, kopyalama ve açma seçenekleriyle
Genel URL'ler
Açılan herhangi bir port için genel URL üretin, sonra yeniden üretin, kapatın ya da yeniden atayın. Yeni portlar aynı sekmeden açılabilir.
API kullanım örnekleri
Çalışan bir motor için: hızlı bir çağrı, bir OpenAI uyumlu istemci parçacığı ve WebUI ile aç.
Sparkrun iş yükleri
Çok düğümlü çalıştırmalar kendi sekmelerinde yaşar; düğüm bazlı loglar, erişim adresleri, motor argümanları, ortam değişkenleri (maskeli) ve tarif YAML'ıyla birlikte.
Temel kavramlar
Uygulama — Cordatus'a kayıtlı bir konteyner imajı; sürümleri, desteklediği cihaz sınıfları ve yayımladığı seçeneklerle.
Ortam — çıkarım motoru değil, bir geliştirme imajı. Aynı başlatma akışı, model adımı yok.
Sürüm / chipset etiketi — belirli bir cihaz sınıfı için belirli bir imaj etiketi; İndirildi ya da İndirilecek olarak gösterilir.
Konteyner grubu — tek bir birim olarak birlikte dağıtılan birkaç konteyner.
Servis katmanı — bir modelin yanında ayağa kalkan isteğe bağlı sohbet arayüzü (Open WebUI) ve API gateway (LiteLLM).
Sparkrun iş yükü — bir DGX Spark cluster'ında çok düğümlü bir çıkarım çalıştırması; Docker konteyneri olmadığı için kendi sekmesinde listelenir.
Kullanıcı modeli (Kullanıcı Modelleri) — cihazlarınızdan birinde hâlihazırda duran ve Cordatus'a kaydedilmiş bir model.
Geçersiz kılmalar — uygulamanın sabitlediklerinin üstüne binen konteyner seçenekleri, ortam değişkenleri, motor bayrakları ve not defteri ayarları. Sabit satırlar kilitlidir ve kaldırılamaz.
Nicemleme — BF16/FP16 (tam kesinlik), INT8/FP8 (belleğin yarısı), INT4/FP4 (dörtte biri) ve kendi ağırlık başına bit sayılarıyla GGUF varyantları.
VRAM bileşenleri — model ağırlıkları, KV önbelleği, aktivasyon belleği ya da ek yük ve boş VRAM.
İyi pratikler
Kaynak yönetimi
- Host Reserved CPU ve RAM değerlerini koruyun; cihazı yanıt verebilir tutan şey odur
- Beklenmedik yük için %20–30 boş VRAM bırakın
- Üretim dağıtımlarından önce VRAM Hesaplayıcı'yı kullanın
- Model seçmeden önce GPU uyum danışmanı satırını okuyun — "sığıyor ama kıl payı", uzun bir bağlamın ya da çok sayıda eşzamanlı isteğin başarısız olabileceği anlamına gelir
Model yönetimi
- HuggingFace, Ollama ve NIM yollarını dağıtım yaptığınız her cihaza kaydedin; aktarım, tarama ve "zaten cihazda" tespiti bunlara bağlıdır
- Parametre sayısı ve nicemlemeyi dolu tutun — uyum danışmanı ve VRAM tahminleri bunları kullanır
- Bir cihazdaki modelleri sildikten sonra Yeniden tara kullanın
- Özel modeller için anlamlı adlar kullanın
Dağıtım
- Önce küçük bir modelle test edin
- İsabetli bir tahmin için VRAM Hesaplayıcı'da Aktivasyon Dahil'i kullanın
- Onaylamadan önce İncele ve başlat'ı okuyun — tam komutu ve her konteyneri gösterir
- Yeni bir imajın ilk dağıtımında logları izleyin
- Servis katmanı kimlik bilgilerini hemen kopyalayın; bir kez gösterilirler