Zkuste nás kontaktovat

Návrh Školení

Suverenita AI a lokální nasazení velkých jazykových modelů

  • Rizika používání cloudových velkých jazykových modelů: uchovávání dat, trénování na vstupech uživatelů a právní jurisdikce cizích států.
  • Architektura Ollamy: server pro modely, registr a API kompatibilní s standardem OpenAI.
  • Srovnání s nástroji vLLM, llama.cpp a Text Generation Inference.
  • Licenční podmínky modelů Llama, Mistral, Qwen a Gemma.

Instalace a nastavení hardwaru

  • Nastavení Ollamy na Linuxu s podporou technologií CUDA a ROCm.
  • Fallback na použití procesoru a optimalizace pro instrukce typu AVX či AVX2.
  • Nasazení pomocí nástroje Docker a mapování trvalých úložných jednotek.
  • Konfigurace více GPU a strategie alokace grafické paměti VRAM.

Správa modelů

  • Stahování modelů z registru Ollamy – např. příkazem ollama pull llama3.
  • Import modelů ve formátu GGUF z platforem HuggingFace a TheBloke.
  • Rozdíly mezi úrovněmi kvantizace: Q4_K_M, Q5_K_M, Q8_0 a jejich dopady na kvalitu i výkon.
  • Přepínání mezi modely a limity pro současné načítání více modelů.

Vlastní konfigurační soubory Modelfile

  • Zápis syntaxe Modelfile: příkazy FROM, PARAMETER, SYSTEM a TEMPLATE.
  • Ladění parametrů jako teplota, hodnota top_p či trest za opakování výrazů.
  • Navrhování systémových pokynů ovlivňujících chování modelu v konkrétním roli.
  • Vytváření a publikování vlastních modelů do místního registru.

Integrace API

  • Koncový bod /v1/chat/completions kompatibilní s OpenAI.
  • Přenos odpovědí v reálném čase a práce v formátu JSON.
  • Integrace do nástrojů LangChain, LlamaIndex i vlastních aplikací.
  • Ochrana prostřednictvím autentizace a omezení počtu žádostí pomocí reverzního proxy serveru.

Optimalizace výkonu

  • Dohoda velikosti kontextové paměti a správa vyrovnávací paměti KV Cache.
  • Provádění dávkových operací inferenze a zvládání paralelních požadavků.
  • Přidělování výpočetních vláken procesoru s ohledem na strukturu NUMA.
  • Sledování využití grafické paměti a zatížení GPU.

Bezpečnost a dodržování předpisů

  • Izolace sítí určených k poskytování modelů.
  • Filtrace vstupních dat a kontrola výstupů z hlediska bezpečnosti.
  • Zaznamenávání aktivit – ukládání všech požadavků a odpovědí modelů.
  • Ověřování původu modelů prostřednictvím kontroly jejich hašovacích hodnot.

Požadavky

  • Středně pokročilé znalosti správy systémů Linux a kontejnerů.
  • Základní porozumění oblasti strojového učení a architektuře transformátorových modelů.
  • Orientace v REST API a formátu JSON.

Cílová skupina

  • Inženýři umělé inteligence a vývojáři, kteří nahrazují cloudová API pro velké jazykové modely.
  • Organizace s citlivými daty, jež nemohou využít cloudové řešení.
  • Vládní a obranné týmy potřebující izolované jazykové modely nepropojené s externími systémy.
 14 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie