Ana içeriğe geç

Application Hub Nedir?

Application Hub, AI applications ve containerized workloads'ı ölçekli bir şekilde dağıtmak, yapılandırmak ve yönetmek için Cordatus'un merkezi bileşenidir. Cihazlarınız genelinde minimum yapılandırmayla LLM inference engines, NVIDIA AI frameworks ve özel Docker konteynerleri başlatmak için birleşik bir arayüz sağlar.

Application Hub, karmaşık Docker dağıtımlarını basit, rehberli iş akışlarına dönüştürür — komut satırı karmaşıklığı veya altyapı detaylarıyla uğraşmadan üretim seviyesinde AI modelleri çalıştırmanıza olanak tanır.

Kimler İçin?

  • Farklı donanım yapılandırmalarında LLM modellerini dağıtması ve test etmesi gereken AI Mühendisleri ve Veri Bilimciler
  • Ölçekli olarak AI altyapısını ve konteyner orkestrasyonunu yöneten DevOps Ekipleri
  • GPU kullanımını ve model performansını optimize etmesi gereken ML Operasyon Mühendisleri
  • Birden fazla cihaz ve konumda dağıtık AI iş yükleri çalıştıran kuruluşlar
  • Farklı modeller, quantization'lar ve inference engine'ler ile deney yapan Araştırmacılar ve Geliştiriciler

Application Hub ile Neler Yapabilirim?

Application Hub ile şunları yapabilirsiniz:

  • AI Applications Dağıtma Önceden yapılandırılmış uygulamaları başlatın, örneğin:

    • vLLM, TensorRT-LLM, Ollama (LLM inference engines)
    • NVIDIA AI Dynamo (dağıtık LLM runtime)
    • NVIDIA VSS (Video Search & Summarization)
    • Özel Docker konteynerleri
  • Gelişmiş Ayarları Yapılandırma

    • GPU Seçimi: Belirli GPU'ları seçin veya mevcut tüm GPU'ları tahsis edin
    • Kaynak Sınırları: Host Reserved koruması ile CPU çekirdek ve RAM sınırları belirleyin
    • Model Seçimi: Cordatus Models, Custom Models veya User Models kullanın
    • Docker Seçenekleri: Portları, volume'ları, ağları ve ortam değişkenlerini yapılandırın
    • Engine Argümanları: Inference parametrelerini (batch size, quantization vb.) hassas şekilde ayarlayın
  • VRAM Gereksinimlerini Hesaplama VRAM Calculator'ı şu amaçlarla kullanın:

    • Dağıtım öncesinde GPU bellek gereksinimlerini tahmin edin
    • Farklı yapılandırmaları (quantization, sequence length, batch size) test edin
    • Modelleriniz için en uygun donanımı belirleyin
    • Çoklu GPU dağıtımlarını planlayın
  • Cihazlar Arası Model Yönetimi User Models ile:

    • Cihazlarınızdaki modelleri Cordatus'a ekleyin
    • Aynı ağdaki cihazlar arasında modelleri aktarın
    • İnternette bulunmayan özel modelleri kullanın
    • Farklı inference engine'ler için volume eşlemelerini otomatik olarak yapılandırın
  • Konteynerleri İzleme ve Kontrol Etme

    • Gerçek zamanlı konteyner durumunu ve loglarını görüntüleyin
    • Konteynerleri tek tek veya gruplar halinde başlatın, durdurun veya silin
    • Dağıtılan uygulamalar için genel URL'ler oluşturun
    • LLM modelleri için Open Web UI arayüzleri oluşturun
    • Değiştirilmiş yapılandırmalarla mevcut konteynerleri çoğaltın

Temel Kavramlar

  • Application — Cordatus'ta kayıtlı, önceden yapılandırılmış bir Docker imajı (örn. vLLM, TensorRT-LLM, NVIDIA Dynamo, NVIDIA VSS). Ayrıntılar için bakınız → Application Launch Guide | Standard Applications | NVIDIA VSS Guide | NVIDIA Dynamo Guide

  • Container — Belirli bir yapılandırmayla (GPU ataması, model, parametreler) çalışan bir uygulama örneği. Ayrıntılar için bakınız → Container Management Guide

  • Container Group — Tek bir birim olarak birlikte dağıtılan birden fazla konteyner (örn. VSS + VLM + LLM + Embed + Rerank). Ayrıntılar için bakınız → Container Management Guide | NVIDIA VSS Guide

  • Model Türleri

    • Cordatus Models: Cordatus sisteminde kayıtlı, önceden test edilmiş modeller
    • Custom Models: İsim veya URL ile belirtilen modeller (dağıtım sırasında indirilir)
    • User Models: Cihazlarınızdan eklediğiniz modeller
  • Inference Engine — LLM modellerini çalıştıran runtime framework:

    • vLLM: PagedAttention ile yüksek verimli inference
    • TensorRT-LLM: NVIDIA'nın optimize edilmiş inference engine'i
    • Ollama: Basit, yerel model dağıtımı
    • NVIDIA NIM: Kurumsal seviyede mikroservisler
  • Quantization — Model ağırlıklarının sıkıştırma formatı:

    • BF16/FP16: Tam hassasiyet (16-bit)
    • INT8/FP8: Yarı bellek kullanımı (8-bit)
    • INT4/FP4: Çeyrek bellek kullanımı (4-bit)
  • Kaynak Sınırları

    • CPU Core Limit: Konteynerin kullanabileceği maksimum CPU çekirdeği
    • RAM Limit: Maksimum bellek tahsisi
    • Host Reserved: Sistem kararlılığı için otomatik olarak ayrılan kaynaklar
    • No Limit: Host Reserved'ı devre dışı bırakır (dikkatli kullanın)
  • VRAM Bileşenleri

    • Model Weights: Model parametrelerinin kapladığı bellek
    • KV Cache: Transformer modelleri için Key-Value cache
    • Overhead/Activation: Sistem yükü veya activation belleği
    • Free VRAM: Kalan kullanılabilir bellek Ayrıntılar için bakınız → VRAM Calculator User Guide

Application Hub Nasıl Çalışır?

  1. Bir Application Seçin

    • Containers > Applications üzerinden mevcut uygulamalara göz atın
    • Uygulama detaylarını, sürümlerini ve desteklenen platformları görüntüleyin
    • Hangi Docker imajlarının cihazınızda zaten indirilmiş olduğunu kontrol edin Ayrıntılar için bakınız → Application Launch Guide
  2. Cihaz ve Sürüm Seçin

    • Dağıtım için hedef cihazı seçin
    • Docker imaj sürümünü seçin
    • Cordatus, imajın indirilmesi gerekip gerekmediğini gösterir
  3. Gelişmiş Ayarları Yapılandırın

    Genel Ayarlar:

    • Ortam adı atayın
    • GPU'ları seçin (veya "All GPU" kullanın)
    • CPU çekirdek ve RAM sınırlarını belirleyin
    • Open Web UI'yi etkinleştirin (LLM uygulamaları için)

    Model Seçimi (LLM Uygulamaları):

    • Cordatus Models, Custom Models veya User Models arasından seçim yapın
    • Cordatus, gerekirse model aktarımını yönetir
    • Inference engine'e göre otomatik volume yapılandırması

    Docker Seçenekleri:

    • Port eşlemelerini yapılandırın (otomatik atanmış veya manuel)
    • Görsel dosya gezgini ile volume bağlantılarını ayarlayın
    • Ağ ayarlarını ve yeniden başlatma politikalarını tanımlayın

    Ortam Değişkenleri:

    • Uygulama için önceden tanımlanmış değişkenleri kullanın
    • Özel değişkenler ekleyin veya hesabınızdan token'ları seçin

    Engine Argümanları:

    • Inference parametrelerini (batch size, quantization vb.) yapılandırın
    • NVIDIA Dynamo için: işlem modunu, router'ı, connector'ı, worker'ları yapılandırın
    • NVIDIA VSS için: VLM, LLM, Embed ve Rerank bileşenlerini yapılandırın
  4. Başlatın ve İzleyin

    • Yapılandırmayı gözden geçirin ve Start Environment'a tıklayın
    • Yetkilendirme için sudo şifresini girin
    • Dağıtım ilerlemesini ve konteyner durumunu izleyin
    • Containers sayfası veya Applications > Containers sekmesi üzerinden konteynerlere erişin Ayrıntılar için bakınız → Container Management Guide
  5. Çalışan Konteynerleri Yönetin

    • Logları ve parametreleri gerçek zamanlı görüntüleyin
    • Dış erişim için genel URL'ler oluşturun
    • Konteynerleri başlatın, durdurun veya silin
    • LLM modelleri için Open Web UI oluşturun
    • Değiştirilmiş ayarlarla konteynerleri çoğaltın

Application Türleri

Standart Uygulamalar

Temel GPU, CPU ve RAM yapılandırmasına sahip basit Docker konteynerleri:

  • Tek konteyner dağıtımı
  • Doğrudan GPU ataması
  • Standart Docker seçenekleri

Ayrıntılar için bakınız → Standard Application Creation Guide

LLM Engine Uygulamaları

Model yönetimi içeren gelişmiş inference engine'ler:

  • Model seçimi (Cordatus, Custom, User Models)
  • Otomatik volume yapılandırması
  • Cihazlar arası model aktarımı
  • İsteğe bağlı Open Web UI oluşturma
  • Engine'e özgü argümanlar

Ayrıntılar için bakınız → Standard Application Creation Guide | User Models Guide

NVIDIA AI Dynamo

Çoklu GPU dağıtımları için dağıtık LLM runtime:

  • İşlem modları (Aggregated/Disaggregated)
  • Router yapılandırması (KV-Aware, Round Robin, Random)
  • Connector kurulumu (KVBM, NIXL, LM Cache)
  • Worker başına worker oluşturma ve GPU ataması
  • Çoklu konteyner orkestrasyonu

Ayrıntılar için bakınız → NVIDIA AI Dynamo Creation Guide

NVIDIA VSS (Video Arama ve Özetleme)

Karmaşık, çok bileşenli bir pipeline:

  • Event Reviewer seçeneğine sahip ana VSS konteyneri
  • VLM (Vision Language Model) bileşeni
  • LLM (Large Language Model) bileşeni
  • Embed (Embedding Model) bileşeni
  • Rerank (Rerank Model) bileşeni
  • Her bileşen yeni, mevcut veya remote application olabilir

Ayrıntılar için bakınız → NVIDIA VSS Creation Guide


User Models ve Model Aktarımı

Model Yol Yapılandırması

Cihazlarınızda şunlar için model yollarını tanımlayın:

  • Huggingface modelleri
  • Ollama modelleri
  • NVIDIA NIM modelleri

Model Ekleme

Model eklemek için iki yöntem:

  1. Start Scanning: Tanımlanan yollardaki modellerin otomatik tespiti
  2. Add Manually: Belirli model dizinlerini seçme

Model Aktarımı

  • Aynı ağdaki cihazlar arasında modelleri aktarın
  • Kesintiye uğrayan aktarımları otomatik olarak devam ettirin
  • Aktarım ilerlemesini gerçek zamanlı takip edin
  • Aktarım sonrası otomatik volume yapılandırması

Model Dağıtımı

  • Herhangi bir User Model'in yanındaki Deploy'a tıklayın
  • Inference engine seçin (vLLM, TensorRT-LLM vb.)
  • Sistem, Application Launch arayüzüne yönlendirir
  • Model, doğru yollarla otomatik olarak yapılandırılır

Daha fazla bilgi: User Models and Model Transfer Guide


VRAM Hesaplayıcı

Dağıtmadan Önce Hesaplayın

Daha fazla bilgi: VRAM Calculator User Guide Önce VRAM gereksinimlerini hesaplayarak dağıtım hatalarından kaçının:

  1. Model Seçin: Kayıtlı modeller arasından seçin veya Hugging Face'te arayın

  2. GPU Seçin: GPU modelini seçin veya cihazın gerçek GPU'larını kullanın

  3. Parametreleri Yapılandırın:

    • Quantization (BF16, FP16, INT8, INT4)
    • Sequence Length (1K - 256K token)
    • Batch Size (1 - 512+)
    • GPU Count (Standalone modu)
    • GPU Memory Utilization (%0 - %100)
    • Calculation Type (Overhead vs Activation)
  4. Sonuçları Görüntüleyin:

    • Bellek dağılımını gösteren görsel doughnut grafiği
    • Her bileşen için detaylı metrikler
    • Sufficient/Insufficient durum göstergesi
    • Kullanım yüzdesi çubuğu

Kullanım Senaryoları

  • GPU satın almadan önce donanım gereksinimlerini test edin
  • Mevcut donanım için quantization ve batch size'ı optimize edin
  • Çoklu GPU dağıtımlarını planlayın
  • Farklı model yapılandırmalarını karşılaştırın

Container Yönetimi

Container İşlemleri

  • Start: Durdurulmuş konteynerleri tek tek veya gruplar halinde başlatın
  • Stop: Çalışan konteynerleri tek tek veya gruplar halinde durdurun
  • Delete: Konteynerleri kaldırın (onaylamak için "DELETE" yazın)
  • Duplicate: Aynı yapılandırmaya sahip yeni bir konteyner oluşturun

Toplu İşlemler

  • Onay kutularını kullanarak birden fazla konteyner seçin
  • Birden fazla konteyneri aynı anda silin
  • İşlemleri tüm konteyner gruplarına uygulayın

Container Bilgisi

Herhangi bir konteyner için detaylı bilgileri görüntüleyin:

  • Logs: Gerçek zamanlı log çıktısı
  • Parameters: Tüm yapılandırma ayarları
  • Ports: Yerel ve genel URL'ler

Genel URL Oluşturma

  • Herhangi bir konteyner portu için herkese açık erişilebilir URL'ler oluşturun
  • Portları yenileyin, devre dışı bırakın veya yeniden atayın
  • Dağıtılan uygulamalara erişimi paylaşın

Open Web UI Oluşturma

LLM engine'ler için:

  • Tek tıkla Open Web UI dağıtımı
  • İsteğe bağlı genel URL oluşturma
  • Modelinizle doğrudan sohbet arayüzü

En İyi Uygulamalar

Kaynak Yönetimi

  • Sistem kararlılığı için her zaman Host Reserved değerlerini koruyun
  • Beklenmedik yükler için %20-30 Free VRAM bırakın
  • Üretim dağıtımlarından önce VRAM Calculator kullanın
  • İş yüküne göre uygun CPU ve RAM sınırları belirleyin

Model Yönetimi

  • Modelleri tutarlı dizin yapılarında organize edin
  • User Models kullanmadan önce tüm cihazlarda model yollarını tanımlayın
  • Özel modeller için anlamlı isimler kullanın
  • Model meta verilerini (quantization, parametreler) güncel tutun

Container Dağıtımı

  • Yapılandırmaları önce küçük modellerle test edin
  • Doğru VRAM tahminleri için Activation hesaplama modunu kullanın
  • İlk dağıtım sırasında konteyner loglarını izleyin
  • Çok bileşenli uygulamalar için konteyner grupları oluşturun

Çoklu GPU Dağıtımları

  • Dağıtık inference için NVIDIA Dynamo kullanın
  • Uygun worker sayılarını ve GPU atamalarını yapılandırın
  • İş yüküne göre router stratejisi seçin (verimlilik için KV-Aware)
  • Tüm worker'lar genelinde GPU kullanımını izleyin

Yardım Alma

Ekran görüntüleri ve videolarla detaylı adım adım talimatlar için:

  • Application Launch Guide: Standart uygulama dağıtımı
  • NVIDIA AI Dynamo Guide: Dağıtık LLM runtime kurulumu
  • NVIDIA VSS Guide: Video analiz pipeline dağıtımı
  • User Models Guide: Model yönetimi ve aktarımı
  • Container Management Guide: Container işlemleri ve izleme
  • VRAM Calculator Guide: Bellek gereksinimi hesaplama