Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Infrastructure as Code pro EXO
- Přehled vzorů nasazení EXO: single-node, multi-node a RDMA klastry
- Automatizace instalace závislostí (Xcode, uv, Node.js, Rust) pomocí správy konfigurace
- Využití Nix flakes pro opakovatelné sestavování EXO a vývojářská prostředí
- Psaní Ansible playbooků nebo skriptů shellu pro bezobslužné zprovozňování klastrů
Opakovatelná sestavení a integrace CI
- Pevné odkazy na závislosti a sestavování dashboardu v pipelinech CI
- Spouštění základních testů EXO ve spínačích GitHub Actions nebo GitLab CI
- Vytváření zlatých obrazů a workflow s rollbackem založeným na snímcích pro virtuální stroje macOS a Linux
- Verzování vlastních karet modelů spolu s kódem aplikace
Automatizace objevování klastrů a sítí
- Konfigurace mDNS a statického DNS pro spolehlivé objevování uzlů libp2p
- Automatizace vytváření síťových profilů a správy Thunderbolt bridge na systému macOS
- Využití vlastních namespace (EXO_LIBP2P_NAMESPACE) k oddělení klastrů dev, staging a prod
- Pravidla firewallu a segmentace sítě pro víceuživatelská prostředí
Správa úložiště a životního cyklu modelů
- Navrhu strategie pro EXO_MODELS_DIRS a EXO_MODELS_READ_ONLY_DIRS
- Připojení dílů NFS nebo SAN jako čitelných úložišť modelů pro rychlé zprovozňování
- Zachytávání starých mezipamětí a politika zachování verzovaných vah
- Automatizace přednostního stahování modelů a kontrol stavu před rolling aktualizacemi
Sledování a upozornění
- Přesměrování logů EXO do centralizovaného protokolování (ELK, Loki nebo Splunk)
- Vytváření přehledů Grafana z výstupu EXO_TRACING_ENABLED
- Upozornění na změny v členství klastru, události OOM a špičky latence při inferenci
- Korelace hardwarové telemetrie macmon s regresemi výkonu modelů
Aktualizace, rollback a katastrofické zotavení
- Ukládání aktualizací binárních souborů EXO do uzlu canary před celoplošným nasazením
- Rollback na úrovni modelu: přepínání mezi kvantizovanými verzemi bez opětovného stahování
- Zálohování a obnovení stavu klastru, vlastních namespace a mezipamětovaných vah
- Dokumentace postupů pro obnovu v případech úplné rebuildy klastru
Posilování bezpečnosti a soulad s předpisy
- Aplikace TLS na vrstvě reverse proxy (nginx, traefik) pro dashboard a API
- Implementace omezení rychlosti API a bílého seznamu IP pro koncové body EXO
- Izolace klastrů pomocí VLAN a politik sítě typu zero-trust
- Audit přístupu a udržování inventáře nasazených modelů a verzí
Požadavky
- Zkušenosti s praktikami DevOps (CI/CD, IaC, orchestrace kontejnerů)
- Seznámení se správou systémů macOS nebo Linux a správcem balíčků
- Povědomí o sítích, DNS a principech úložišť
Cílová skupina
- Inženýři DevOps
- Architekti infrastruktury
- SRE zodpovědní za on-premise pracovní zátěže AI
21 Hodiny
Reference (2)
Craig byl extrémně zapojen do školení, vždy se ujistil, že jsme soustředění, přizpůsobil příklady našim každodenním aktivitám a pokaždé poskytl odpověď, když jsme se zeptali, i když informace nebyly zahrnuty do prezentace.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Kurz - DevOps Foundation®
Přeloženo strojem
Vysoký stupeň závazku a znalostí trenéra
Jacek - Softsystem
Kurz - DevOps Engineering Foundation (DOEF)®
Přeloženo strojem