NVIDIA AI Dynamo Oluşturma Kılavuzu
Bu rehber, Cordatus Platform üzerinden NVIDIA AI Dynamo'nun nasıl oluşturulacağını ve yapılandırılacağını açıklar. NVIDIA AI Dynamo, büyük dil modellerinin (LLM) çoklu GPU ve çoklu node ortamlarında verimli bir şekilde çalıştırılmasını sağlayan güçlü bir dağıtık runtime framework'üdür.
Cordatus sayesinde kullanıcılar, tercih ettikleri modelle NVIDIA AI Dynamo'yu vLLM Runtime üzerinde minimum yapılandırmayla kolayca başlatabilir. Bu, prefill ve decode işlemlerinin birden fazla GPU arasında akıllıca dağıtılmasını sağlayarak hem performansı hem de ölçeklenebilirliği optimize eder.
Ayrıntılar için bakınız → Application Hub Overview | Application Hub Quickstart | Standard Application Launch Guide | Container Management Guide
NVIDIA AI Dynamo Hakkında
NVIDIA AI Dynamo, büyük ölçekli AI model iş yükleri için tasarlanmış yüksek performanslı bir dağıtık çalıştırma motorudur. Belleği, hesaplamayı ve iletişimi verimli bir şekilde yöneterek birden fazla GPU veya node'un büyük LLM görevlerini işbirliği içinde işlemesine olanak tanır.
Dynamo aşağıdaki temel yetenekleri sunar:
- GPU'lar arasında prefill ve decode görevlerinin paralel çalıştırılması
- KV Cache bloklarının optimize edilmiş yönetimi
- Worker'lar arasında düşük gecikmeli veri aktarımları
- Dağıtık inference iş yükleri için dinamik ölçeklenebilirlik
Cordatus Platform, kullanıcı dostu bir arayüzle Dynamo'nun teknik karmaşıklığını soyutlayarak kullanıcıların runtime modlarını, yönlendirme stratejilerini, connector'ları ve GPU atamalarını zahmetsizce tanımlamasına olanak tanır.
NVIDIA AI Dynamo Başlatma Adımları
Uygulamayı Seçme
- Sol taraftaki menüden Containers'a tıklayın.
- Açılan alt menüden Applications'ı seçin.
- Uygulama listesinden Dynamo'yu seçin ve Detay sayfasına gidin.
Cihaz ve Sürüm Seçimi
- Start Application'a tıklayın.
- Açılan modal pencerede, NVIDIA Dynamo'yu çalıştırmak istediğiniz cihazı seçin ve ona bağlanın.
- Mevcut Docker imaj sürümlerinin gösterildiği Version adımına geçin.
- İmaj cihazınızda zaten kuruluysa, indirilmiş simgesi görünür.
- Değilse, indirilecek simgesi gösterilir.
Gelişmiş Ayarlar
Son adım sizi, NVIDIA AI Dynamo konteynerinizi başlatmak için tüm parametreleri yapılandırabileceğiniz Advanced Settings sayfasına götürür.
Gelişmiş Ayarlar Detayları
Genel Ayarlar
-
Environment Name: Konteynerinize özel bir isim atayın. Boş bırakılırsa Cordatus otomatik olarak bir isim oluşturur.
-
Enable Open Web UI: Etkinleştirildiğinde Cordatus, dağıtım sırasında otomatik olarak bir Open Web UI container oluşturur. Bu, çalışan modelinizle doğrudan bir tarayıcı arayüzü üzerinden etkileşime girmenizi sağlar.
Daha fazla bilgi: İşlevsellik ve yapılandırma, standart uygulamalarla aynıdır. Detaylı açıklama ve video eğitimi için Enable Open Web UI - Bölüm 5.2'ye bakın.
-
Model Selection: Sağ alt panelde, çalıştırılacak modeli seçebilirsiniz. Üç seçenek mevcuttur:
-
Cordatus Models: Cordatus sisteminde önceden test edilmiş ve kayıtlı modelleri, etiketleriyle birlikte gösterir.
💡 Smart Volume Detection: Cihazınızda model yollarını yapılandırdıysanız, Cordatus kurulu modelleri otomatik olarak alg ılar ve seçilen Cordatus Model'in cihazınızda zaten mevcut olup olmadığını kontrol eder. Bulunursa, Cordatus yerel kopyanızı kullanmak için volume bağlantısını otomatik olarak yapılandırır. Model yerel olarak bulunamazsa varsayılan volume bağlantı yolu kullanılır (model konteyner başlatma sırasında indirilir), ancak gerekirse bunu Docker Options bölümünden manuel olarak değiştirebilirsiniz.
-
Custom Model: Çalıştırmak istediğiniz model sistemde yoksa, adını manuel olarak Model Name alanına girin.
Daha fazla bilgi: Kullanım, standart uygulamalarla aynıdır. Detaylı açıklama ve video eğitimi için Custom Model - Bölüm 5.2'ye bakın.
-
User Models: Daha önce tanımlayıp Cordatus hesabınıza eklediğiniz modelleri gösterir.
Daha fazla bilgi: Yapılandırma ve kullanım süreci standart uygulamalarla aynıdır. Aşağıdakiler dahil eksiksiz ayrıntılar için User Models - Bölüm 5.2'ye bakın:
- Aynı Cihaz Kullanımı
- Model Transfer Özelliği
- Otomatik Volume Yapılandırması
- Her iki senaryo için video eğitimleri
-
-
Resource Limits: Konteynerinizin ne kadar CPU ve RAM kullanabileceğini kontrol edin. Resource Limits bölümü, konteyner performansını optimize etmenize ve sistem kaynaklarını verimli bir şekilde yönetmenize olanak tanır.
CPU Core Assignment: Konteynerinizin kullanacağı maksimum CPU çekirdeği sayısını sınırlayabilirsiniz.
-
Setting Limits: Konteynerin kaç CPU çekirdeği kullanabileceğini manuel olarak belirtin.
-
Host Reserved: Cordatus, cihazınızın normal şekilde çalışmaya devam etmesini sağlamak için sistem işlemleri için otomatik olarak belirli miktarda CPU çekirdeği ayırır. Bu nedenle tüm CPU çekirdeklerini maksimum limit olarak konteynere atayamazsınız.
-
No Limit Option: Tüm CPU kaynaklarını konteynere tahsis etmek istiyorsanız, sağ üst köşedeki No Limit seçeneğini işaretleyin. Bu, Host Reserved kısıtlamasını kaldırır ve tüm kaynakları konteyner için kullanılabilir hale getirir.
RAM Assignment: Sisteminizin toplam RAM'inin ne kadarının maksimum limit olarak konteynere tahsis edilebileceğini belirtebilirsiniz.
-
Setting Limits: Konteynerin kullanabileceği RAM miktarını manuel olarak tanımlayın.
-
Host Reserved: Cordatus, cihazınızın düzgün çalışmasını sağlamak için sistem kararlılığı adına otomatik olarak belirli miktarda RAM ayırır. Bu nedenle tüm RAM kapasitesini maksimum limit olarak konteynere atayamazsınız.
-
No Limit Option: Tüm RAM kaynaklarını konteynere tahsis etmek istiyorsanız, sağ üst köşedeki No Limit seçeneğini işaretleyin. Bu, Host Reserved kısıtlamasını kaldırır ve tüm RAM'i konteyner için kullanılabilir hale getirir.
⚠️ Uyarı: No Limit seçeneğini kullanmak, tüm sistemi konteynere tahsis eder; bu, cihazınızın performansını ve kararlılığını olumsuz etkileyebilir. Bu seçeneği dikkatli kullanın.
💡 Öneri: En iyi performans ve sistem kararlılığı için, kaynak tahsisi sırasında Cordatus tarafından otomatik olarak ayarlanan Host Reserved değerlerini korumanız önerilir.
-
İşlem Modu (Processing Mode)
Bu bölüm, NVIDIA Dynamo'nun iş yüklerini GPU'lar arasında nasıl dağıttığını tanımlar.
-
Aggregated Mode: Hem prefill hem de decode işlemleri aynı GPU üzerinde çalıştırılır. Küçük ve orta ölçekli dağıtımlar için uygundur.
-
Disaggregated Mode: Prefill ve decode işlemleri farklı GPU'larda çalışır ve büyük ölçekli modeller için performansı optimize eder.
İşlem modu seçimi, aşağıda açıklandığı gibi GPU ataması ve worker oluşturmayı doğrudan etkiler.