Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Doba trvání 14 hodiny
Návrh Školení
Základy nasazení modelů Tencent Hunyuan do produkce
- Přehled možností nasazení modelů Tencent Hunyuan
- Produkční charakteristiky velkých a MoE modelů
- Běžné překážky v oblasti latence, propustnosti a nákladů
- Stanovení cílů kvality služeb pro pracovní zátěž inferenze
Architektura nasazení a toky zpracování požadavků
- Hlavní prvky produkční infrastruktury pro inferenzi
- Volba mezi kontejnerizovaným, lokálním nebo cloudovým modelem nasazení
- Základy načítání modelů, směrování požadavků a alokace GPU zdrojů
- Návrh s ohledem na spolehlivost a snadnou obsluhu
Praktická optimalizace latence
- Využití optimalizovaných nástrojů pro inferenzi jako je TensorRT tam, kde to je vhodné
- Principy fungování KV-cache a praktické možnosti jejího ladění
- Omezení doby spouštění, přípravných operací a odezvy systému
- Měření doby vyslání prvního tokenu a rychlosti generování dalších tokenů
Propustnost, skupinování požadavků a efektivita využití GPU
- Strategie nepřetržitého i požadavkového skupinování procesů
- Správa souběžnosti a chování front požadavků
- Zvyšování efektivního využití GPU bez snižování kvality uživatelské zkušenosti
- Řešení situací s dlouhými kontexty nebo smíšenou skladbou požadavků
Kvantizace a kontrola nákladů
- Důvody, proč je kvantizace důležitá při nasazování do produkce
- Praktické kompromisy mezi formáty FP16, INT8 a dalšími běžnými variantami precize
- Vyvažování kvality modelu, latence a nákladů na infrastrukturu
- Sestavení jednoduchého seznamu pro optimalizaci provozních výdajů
Provozní činnosti, monitorování a kontrola připravenosti systému
- Spouštěče automatického škálování pro služby inferenze
- Sledování latence, propustnosti, využití cache a stavu GPU zdrojů
- Zaznamenávání logů, nastavování upozornění a základy reakce na incidenty
- Analýza referenčního nasazení a sestavení plánu pro jeho vylepšení
Požadavky
- Základní znalosti o nasazování velkých jazykových modelů a pracovních postupech inferenze
- Zkušenosti s kontejnery, cloudovou či lokální infrastrukturou a službami využívajícími API
- Praktické znalosti Pythonu nebo systémového inženýrství
Cílová skupina
- ML inženýři nasazující LLM modely do produkce
- Platformní inženýři zodpovědní za služby inferenze využívající GPU
- Architekti navrhující škálovatelné platformy pro poskytování AI služeb