Zkuste nás kontaktovat

Návrh Školení

Infrastruktura EXO jako kód

  • Přehled možností nasazení EXO: jedno- i vícenodové clustery a konfigurace s využitím technologie RDMA
  • Automatizace instalace závislostí (Xcode, uv, Node.js, Rust) pomocí nástrojů pro správu konfigurací
  • Použití nástroje Nix flakes k vytváření reprodukovatelných sestavení EXO a vývojových prostředí
  • Psaní skriptů v Ansible nebo shellu pro automatické zřízení celých clusterů

Reprodukovatelné sestavení a integrace do CI systémů

  • Pevné určování verzí závislostí a tvorba dashboardu v rámci CI pipeline.
  • Provádění kontrolních testů EXO v prostředí GitHub Actions či GitLab CI.
  • Tvorba referenčních „zlatých“ obrazů systému a postupů pro vrácení změn u virtuálních strojů macOS i Linux.
  • Správa verzí vlastních definic modelů spolu s kódem aplikace.

Automatizace detekce clusterů a síťové konfigurace

  • Nastavení protokolů mDNS a statického DNS pro spolehlivou detekci uzlů v síti libp2p.
  • Automatizace tvorby síťových profilů a správy mostů Thunderbolt na platformě macOS.
  • Použití vlastních oborů názvů (EXO_LIBP2P_NAMESPACE) k oddělení vývojových, testovacích a produkčních clusterů.
  • Nastavování pravidel firewallu a segmentace sítě pro prostředí s více klienty.

Správa úložišť a životního cyklu modelů

  • Navrhování vhodných konfigurací pro proměnné EXO_MODELS_DIRS a EXO_MODELS_READ_ONLY_DIRS.
  • Připojování sdílených úložišť typu NFS či SAN jako pouze pro čtení určených k rychlému načítání modelů.
  • Uvolňování prostoru zastaralými mezipamětěmi a stanovení pravidel uchovávání verzovaných váhových souborů.
  • Automatizace předběžného stahování modelů a jejich ověření před vydáním aktualizací.

Monitorování a alarmy

  • Odesílání logů EXO do centralizovaných systémů (ELK, Loki nebo Splunk).
  • Tvorba grafických dashboardů v nástroji Grafana na základě dat generovaných volbou EXO_TRACING_ENABLED.
  • Vytváření upozornění při změnách ve struktuře clusteru, výskytu situací s nedostatkem paměti nebo náhlém nárůstu prodlevy při vyhodnocování modelů.
  • Srovnávání telemetrických dat z hardwaru macmon s chováním a výkonností jednotlivých modelů.

Aktualizace, vrácení změn a havarijní obnova

  • Postupné nasazování nové verze binárního kódu EXO na jednotlivé uzly před masovým upgradem.
  • Návrat ke starším verzím modelů – výměna kvantovaných variant bez nutnosti jejich opětovného stahování.
  • Vytváření záloh a obnova celého stavu clusteru, včetně definic vlastních oborů názvů a uložených váhových dat.
  • Sepsání postupů pro rychlou rekonstrukci celého prostředí v případě katastrofické situace.

Zpřísnění bezpečnosti a shoda s předpisy

  • Použití protokolu TLS na úrovni reverzních proxy serverů (nginx, Traefik) pro ochranu dashboardu i API rozhraní.
  • Stanovení limitů počtu požadavků a omezení přístupu pouze povoleným IP adresám u koncových bodů EXO.
  • Oddělování jednotlivých clusterů pomocí VLAN sítí a uplatňování zásad typu „zero trust“.
  • Auditování přístupů a evidování všech nasazených modelů spolu s jejich konkrétními verzemi.

Požadavky

  • Praktické zkušenosti s postupy DevOps (CI/CD, IaC, orchestrace kontejnerů)
  • Ovládání systémové správy a správy balíčků na platformách macOS či Linux
  • Znalost základních principů sítí, DNS a ukládání dat

Cílové skupiny

  • Inženýři DevOps
  • Architekti infrastruktury
  • SRE specialisté zodpovědní za provoz lokálních systémů umělé inteligence
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (2)

Nadcházející kurzy

Související kategorie