Zkuste nás kontaktovat

Návrh Školení

Úvod do EXO a lokálního shlukování AI

  • Přehled frameworku EXO a ekosystému exo-explore
  • Srovnání centrální cloudové inferenční s distributní místní inferencí
  • Architektura: zjišťování zařízení prostřednictvím libp2p, backend MLX, rozhraní a vrstva API
  • Výběrové požadavky: Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, sdílené úložiště

Nasazení EXO na macOS

  • Nastavení Xcode, Metal ToolChain a požadavků pro macOS
  • Instalace uv, Node.js, Rust nightly toolchain
  • Instalace forku macmon určeného pro monitorování Apple Silicon
  • Klonování repozitáře a sestavení dashboardu pomocí npm
  • Spuštění EXO ze zdroje a ověření dashboardu na localhost:52415

Nasazení EXO na Linuxu

  • Instalace závislostí prostřednictvím apt nebo Homebrew na Linuxu
  • Konfigurace uv, Node.js 18+ a Rust nightly
  • Sestavení dashboardu a spuštění EXO v režimu pouze CPU
  • Struktura adresářů: cesty XDG Base Directory pro konfiguraci, data, cache a logy

Automatické zjišťování zařízení a formace clusteru

  • Chápání automatického zjišťování založeného na libp2p napříč místní sítí
  • Konfigurace vlastních jmenových prostorů pomocí EXO_LIBP2P_NAMESPACE pro izolaci clusteru
  • Ověření příslušnosti uzlu v pohledu dashboardu clusteru
  • Zvládání selhání při zjišťování a problémů se segmentací sítě

Povolování RDMA přes Thunderbolt 5

  • Architektura RDMA a tvrzení o snížení latency o 99 procent
  • Povolování RDMA v režimu macOS Recovery s rdma_ctl
  • Požadavky na kabeláž a omezení topologie portů na Mac Studio
  • Doladění verzí macOS napříč všemi uzly clusteru
  • Odznačování RDMA discovery a konfigurace DHCP

Nasazení předových modelů

  • Použití dashboardu k načtení a shardování DeepSeek v3.1, Qwen3-235B a rodiny modelů Llama
  • Ukázka umístění instancí prostřednictvím koncového bodu API /instance/previews
  • Vytváření instance modelu s pipeline nebo tensor-parallel shardingem
  • Konfigurace vlastních karet modelu z HuggingFace hubu

Sledování a diagnostika problémů

  • Čtení logů EXO a porozumění distributnímu trasování
  • Výklad zdraví clusteru v pohledu dashboardu clusteru
  • Diagnostika selhání pracovního uzlu a chování při znovu připojení
  • Použití EXO_TRACING_ENABLED pro analýzu výkonnostních hrdel krku

Údržba a aktualizace clusteru

  • Aktualizace binárních souborů EXO a postupy přestavby dashboardu
  • Migrace mezipaměti modelů a správa předstažených modelů přes NFS
  • Plynulé odebrání uzlů a vyvážení zátěže

Požadavky

  • Pochopení základů sítě (IP, subnetworking, firewall)
  • Zkušenosti se správou příkazového řádku v macOS nebo Linuxu
  • Seznámenost s řízením balíčků Pythonu (pip/uv) a nástrojovými sadami Node.js

Cílová skupina

  • Systémoví administrátoři
  • DevOps inženýři
  • Architekti AI infrastruktury odpovědní za on-premise nasazení LLM
 21 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie