Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Doba trvání 21 hodiny
Návrh Školení
Úvod do škálování Ollama
- Architektura Ollama a úvahy týkající se škálování
- Běžné úzká místa při nasazování pro více uživateli
- Osvědčené postupy pro připravenost infrastruktury
Alokace zdrojů a optimalizace GPU
- Strategie efektivního využití CPU/GPU
- Úvahy týkající se paměti a šířky pásma
- Omezení zdrojů na úrovni kontejneru
Nasazení s kontejnery a Kubernetes
- Kontejnerizace Ollama pomocí Dockeru
- Běh Ollama v klastru Kubernetes
- Rozdělování zátěže a objev služeb
Automatické škálování a sbalování
- Návrh politik automatického škálování pro Ollama
- Techniky inference ve sbalování pro optimalizaci propustnosti
- Kompromis mezi latencí a propustností
Optimalizace latence
- Profilování výkonu inference
- Strategie cache a zahřívání modelu
- Snižování I/O a komunikační přirážky
Monitorování a observabilita
- Integrace Prometheus pro metriky
- Tvorbě dashboardů pomocí Grafany
- Upozorňování a reakce na incidenty pro infrastrukturu Ollama
Správa nákladů a strategie škálování
- Alokace GPU s ohledem na náklady
- Úvahy k nasazení v cloudu vs. lokálně (on-prem)
- Strategie udržitelného škálování
Shrnutí a další kroky
Požadavky
- Zkušenosti s administrací systémů Linux
- Chopení kontejnerizace a orkestrace
- Znalost nasazování modelů strojového učení
Cílová skupina
- DevOps inženýři
- Tímy pro ML infrastrukturu
- Inženýři pro spolehlivost webů (SRE)