Zkuste nás kontaktovat

Návrh Školení

Infrastructure as Code pro EXO

  • Přehled vzorů nasazení EXO: single-node, multi-node a RDMA klastry
  • Automatizace instalace závislostí (Xcode, uv, Node.js, Rust) pomocí správy konfigurace
  • Využití Nix flakes pro opakovatelné sestavování EXO a vývojářská prostředí
  • Psaní Ansible playbooků nebo skriptů shellu pro bezobslužné zprovozňování klastrů

Opakovatelná sestavení a integrace CI

  • Pevné odkazy na závislosti a sestavování dashboardu v pipelinech CI
  • Spouštění základních testů EXO ve spínačích GitHub Actions nebo GitLab CI
  • Vytváření zlatých obrazů a workflow s rollbackem založeným na snímcích pro virtuální stroje macOS a Linux
  • Verzování vlastních karet modelů spolu s kódem aplikace

Automatizace objevování klastrů a sítí

  • Konfigurace mDNS a statického DNS pro spolehlivé objevování uzlů libp2p
  • Automatizace vytváření síťových profilů a správy Thunderbolt bridge na systému macOS
  • Využití vlastních namespace (EXO_LIBP2P_NAMESPACE) k oddělení klastrů dev, staging a prod
  • Pravidla firewallu a segmentace sítě pro víceuživatelská prostředí

Správa úložiště a životního cyklu modelů

  • Navrhu strategie pro EXO_MODELS_DIRS a EXO_MODELS_READ_ONLY_DIRS
  • Připojení dílů NFS nebo SAN jako čitelných úložišť modelů pro rychlé zprovozňování
  • Zachytávání starých mezipamětí a politika zachování verzovaných vah
  • Automatizace přednostního stahování modelů a kontrol stavu před rolling aktualizacemi

Sledování a upozornění

  • Přesměrování logů EXO do centralizovaného protokolování (ELK, Loki nebo Splunk)
  • Vytváření přehledů Grafana z výstupu EXO_TRACING_ENABLED
  • Upozornění na změny v členství klastru, události OOM a špičky latence při inferenci
  • Korelace hardwarové telemetrie macmon s regresemi výkonu modelů

Aktualizace, rollback a katastrofické zotavení

  • Ukládání aktualizací binárních souborů EXO do uzlu canary před celoplošným nasazením
  • Rollback na úrovni modelu: přepínání mezi kvantizovanými verzemi bez opětovného stahování
  • Zálohování a obnovení stavu klastru, vlastních namespace a mezipamětovaných vah
  • Dokumentace postupů pro obnovu v případech úplné rebuildy klastru

Posilování bezpečnosti a soulad s předpisy

  • Aplikace TLS na vrstvě reverse proxy (nginx, traefik) pro dashboard a API
  • Implementace omezení rychlosti API a bílého seznamu IP pro koncové body EXO
  • Izolace klastrů pomocí VLAN a politik sítě typu zero-trust
  • Audit přístupu a udržování inventáře nasazených modelů a verzí

Požadavky

  • Zkušenosti s praktikami DevOps (CI/CD, IaC, orchestrace kontejnerů)
  • Seznámení se správou systémů macOS nebo Linux a správcem balíčků
  • Povědomí o sítích, DNS a principech úložišť

Cílová skupina

  • Inženýři DevOps
  • Architekti infrastruktury
  • SRE zodpovědní za on-premise pracovní zátěže AI
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (2)

Nadcházející kurzy

Související kategorie