Zkuste nás kontaktovat

Návrh Školení

Úvod do škálování Ollamy

  • Architektura Ollamy a aspekty související se škálováním
  • Běžné úzká místa při nasazení pro více uživatelů
  • Nejlepší postupy pro připravenost infrastruktury

Přidělování zdrojů a optimalizace využití GPU

  • Strategie efektivního využití CPU a GPU
  • Otázky týkající se paměti a šířky pásma
  • Omezení zdrojů na úrovni kontejnerů

Nasazení s využitím kontejnerů a Kubernetes

  • Kontejnerizace Ollamy pomocí Dockeru
  • Provoz Ollamy v clusterových prostředích Kubernetes
  • Rovnoměrné rozdělování zátěže a vyhledávání služeb

Automatické škálování a dávkování požadavků

  • Návrh zásad automatického škálování pro Ollamu
  • Techniky dávkového vyhodnocování za účelem optimalizace propustnosti
  • Kompromisy mezi latencí a propustností

Optimalizace latence

  • Profilování výkonu vyhodnocování modelů
  • Strategie ukládání výsledků do mezipaměti a předběžného nahřátí modelů
  • Omezování režijních nákladů spojených s vstupně-výstupními operacemi a komunikací

Sledování a monitorování systému

  • Integrace nástroje Prometheus pro sběr metrik
  • Tvorba vizualizací pomocí nástroje Grafana
  • Nastavení upozornění a reakce na incidenty v infrastruktuře Ollamy

Správa nákladů a strategie škálování

  • Přidělování GPU s ohledem na náklady
  • Hodnocení výhod a nevýhod nasazení v cloudu oproti místním serverům
  • Strategie udržitelného rozšiřování infrastruktury

Shrnutí a další kroky

Požadavky

  • Zkušenosti s správou systémů Linuxu
  • Přehled o kontejnerizaci a orchestraci
  • Orientace v nasazování strojově učících modelů

Cílová skupina

  • Inženýři DevOps
  • Týmy zabývající se infrastrukturou pro strojové učení
  • Specialisté na spolehlivost systémů
 21 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie