Zkuste nás kontaktovat

Návrh Školení

Úvod do EXO a principů lokálních AI clusterů

  • Přehled frameworku EXO a ekosystému exo-explore.
  • Srovnání centrálního cloudového inferenčního řešení s distribuovanou lokální variantou.
  • Architektura: technologie libp2p pro rozpoznávání zařízení, backend MLX, řídicí panel a API vrstvy.
  • Požadavky na hardware: procesory Apple Silicon (M3 Ultra, M4 Pro/Max), rozhraní Thunderbolt 5 a sdílené úložiště.

Instalace EXO na systému macOS

  • Nastavení Xcode, nástrojů Metal ToolChain a dalších požadavků pro macOS.
  • Instalace nástrojů uv, Node.js a noční verze Rustu.
  • Nainstalování speciální verze macmon určené k monitorování zařízení s procesory Apple Silicon.
  • Klonování repozitáře a vytvoření řídicího panelu pomocí nástroje npm.
  • Spuštění EXO z vygenerovaného kódu a ověření fungování panelu na adrese localhost:52415.

Instalace EXO na systému Linux

  • Nastavení potřebných závislostí pomocí nástrojů apt či Homebrew.
  • Konfigurace nástrojů uv, Node.js 18+ a noční verze Rustu.
  • Sestavení řídicího panelu a spuštění EXO v režimu bez hardwarové akcelerace.
  • Struktura adresářů: umístění konfiguračních souborů, dat, mezipaměti a logů dle standardů XDG Base Directory.

Automatické rozpoznávání zařízení a vytváření clusteru

  • Principy automatického vyhledávání zařízení v místní síti pomocí technologie libp2p.
  • Nastavení vlastních identifikátorů s použitím proměnné EXO_LIBP2P_NAMESPACE pro izolaci jednotlivých clusterů.
  • Ověření přítomnosti všech uzlů v zobrazení clusteru na řídicím panelu.
  • Řešení problémů s detekcí zařízení a segmentací sítě.

Povolení komunikace mezi uzly pomocí technologie RDMA přes Thunderbolt 5

  • Architektura RDMA a tvrzení o snížení latence až o 99 procent.
  • Aktivace funkce RDMA v režimu obnovy systému macOS pomocí nástroje rdma_ctl.
  • Požadavky na kabeláž a konfiguraci portů na zařízeních Mac Studio.
  • Soulad verzí operačního systému napříč všemi uzly clusteru.
  • Odstraňování problémů s detekcí zařízení a nastavením protokolu DHCP.

Nasazení špičkových modelů

  • Použití řídicího panelu k načtení a rozdělení modelů DeepSeek v3.1, Qwen3-235B a rodiny Llama mezi jednotlivé uzly.
  • Náhled umístění instancí pomocí API endpointu /instance/previews.
  • Vytváření modelových instancí s využitím technik shardingu pipeline nebo tensor-parallel.
  • Nastavení vlastních konfigurací modelů stažených z platformy HuggingFace.

Monitorování a odstraňování problémů

  • Čtení logů systému EXO a pochopení principů distribuovaného sledování aktivit.
  • Interpretace stavu celého clusteru v zobrazení na řídicím panelu.
  • Diagnostika problémů u jednotlivých uzlů a chování při jejich opětovném připojení.
  • Použití nástroje EXO_TRACING_ENABLED k identifikaci míst s největším výkonnostním zatížením.

Údržba a aktualizace clusteru

  • Aktualizace binárních souborů EXO a postupy při přestavbě řídicího panelu.
  • Přesun uložených modelových dat a správa modellů již stažených do systému přes síť NFS.
  • Gentilní odstranění nepotřebných uzlů a vyvážení zátěže v rámci clusteru.

Požadavky

  • Pochopení základních principů sítí (IP adresy, podsítě, firewally)
  • Zkušenosti s administrací přes příkazový řádek v systémech macOS nebo Linux.
  • Orientace v správě balíčků Pythonu (pip/uv) a nástrojích Node.js.

Cílová skupina

  • Systémoví administrátoři
  • DevOps inženýři
  • Architekti AI infrastruktury zodpovědní za lokální nasazení velkých jazykových modelů.
 21 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie