Zkuste nás kontaktovat
 Doba trvání 21 hodiny

Návrh Školení

Úvod do škálování Ollama

  • Architektura Ollama a úvahy týkající se škálování
  • Běžné úzká místa při nasazování pro více uživateli
  • Osvědčené postupy pro připravenost infrastruktury

Alokace zdrojů a optimalizace GPU

  • Strategie efektivního využití CPU/GPU
  • Úvahy týkající se paměti a šířky pásma
  • Omezení zdrojů na úrovni kontejneru

Nasazení s kontejnery a Kubernetes

  • Kontejnerizace Ollama pomocí Dockeru
  • Běh Ollama v klastru Kubernetes
  • Rozdělování zátěže a objev služeb

Automatické škálování a sbalování

  • Návrh politik automatického škálování pro Ollama
  • Techniky inference ve sbalování pro optimalizaci propustnosti
  • Kompromis mezi latencí a propustností

Optimalizace latence

  • Profilování výkonu inference
  • Strategie cache a zahřívání modelu
  • Snižování I/O a komunikační přirážky

Monitorování a observabilita

  • Integrace Prometheus pro metriky
  • Tvorbě dashboardů pomocí Grafany
  • Upozorňování a reakce na incidenty pro infrastrukturu Ollama

Správa nákladů a strategie škálování

  • Alokace GPU s ohledem na náklady
  • Úvahy k nasazení v cloudu vs. lokálně (on-prem)
  • Strategie udržitelného škálování

Shrnutí a další kroky

Požadavky

  • Zkušenosti s administrací systémů Linux
  • Chopení kontejnerizace a orkestrace
  • Znalost nasazování modelů strojového učení

Cílová skupina

  • DevOps inženýři
  • Tímy pro ML infrastrukturu
  • Inženýři pro spolehlivost webů (SRE)

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie