Zkuste nás kontaktovat

Návrh Školení

Základy nasazení modelů Tencent Hunyuan do produkce

  • Přehled možností nasazení modelů Tencent Hunyuan
  • Produkční charakteristiky velkých a MoE modelů
  • Běžné překážky v oblasti latence, propustnosti a nákladů
  • Stanovení cílů kvality služeb pro pracovní zátěž inferenze

Architektura nasazení a toky zpracování požadavků

  • Hlavní prvky produkční infrastruktury pro inferenzi
  • Volba mezi kontejnerizovaným, lokálním nebo cloudovým modelem nasazení
  • Základy načítání modelů, směrování požadavků a alokace GPU zdrojů
  • Návrh s ohledem na spolehlivost a snadnou obsluhu

Praktická optimalizace latence

  • Využití optimalizovaných nástrojů pro inferenzi jako je TensorRT tam, kde to je vhodné
  • Principy fungování KV-cache a praktické možnosti jejího ladění
  • Omezení doby spouštění, přípravných operací a odezvy systému
  • Měření doby vyslání prvního tokenu a rychlosti generování dalších tokenů

Propustnost, skupinování požadavků a efektivita využití GPU

  • Strategie nepřetržitého i požadavkového skupinování procesů
  • Správa souběžnosti a chování front požadavků
  • Zvyšování efektivního využití GPU bez snižování kvality uživatelské zkušenosti
  • Řešení situací s dlouhými kontexty nebo smíšenou skladbou požadavků

Kvantizace a kontrola nákladů

  • Důvody, proč je kvantizace důležitá při nasazování do produkce
  • Praktické kompromisy mezi formáty FP16, INT8 a dalšími běžnými variantami precize
  • Vyvažování kvality modelu, latence a nákladů na infrastrukturu
  • Sestavení jednoduchého seznamu pro optimalizaci provozních výdajů

Provozní činnosti, monitorování a kontrola připravenosti systému

  • Spouštěče automatického škálování pro služby inferenze
  • Sledování latence, propustnosti, využití cache a stavu GPU zdrojů
  • Zaznamenávání logů, nastavování upozornění a základy reakce na incidenty
  • Analýza referenčního nasazení a sestavení plánu pro jeho vylepšení

Požadavky

  • Základní znalosti o nasazování velkých jazykových modelů a pracovních postupech inferenze
  • Zkušenosti s kontejnery, cloudovou či lokální infrastrukturou a službami využívajícími API
  • Praktické znalosti Pythonu nebo systémového inženýrství

Cílová skupina

  • ML inženýři nasazující LLM modely do produkce
  • Platformní inženýři zodpovědní za služby inferenze využívající GPU
  • Architekti navrhující škálovatelné platformy pro poskytování AI služeb
 14 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie