Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Suverenita AI a lokální nasazení velkých jazykových modelů
- Rizika používání cloudových velkých jazykových modelů: uchovávání dat, trénování na vstupech uživatelů a právní jurisdikce cizích států.
- Architektura Ollamy: server pro modely, registr a API kompatibilní s standardem OpenAI.
- Srovnání s nástroji vLLM, llama.cpp a Text Generation Inference.
- Licenční podmínky modelů Llama, Mistral, Qwen a Gemma.
Instalace a nastavení hardwaru
- Nastavení Ollamy na Linuxu s podporou technologií CUDA a ROCm.
- Fallback na použití procesoru a optimalizace pro instrukce typu AVX či AVX2.
- Nasazení pomocí nástroje Docker a mapování trvalých úložných jednotek.
- Konfigurace více GPU a strategie alokace grafické paměti VRAM.
Správa modelů
- Stahování modelů z registru Ollamy – např. příkazem ollama pull llama3.
- Import modelů ve formátu GGUF z platforem HuggingFace a TheBloke.
- Rozdíly mezi úrovněmi kvantizace: Q4_K_M, Q5_K_M, Q8_0 a jejich dopady na kvalitu i výkon.
- Přepínání mezi modely a limity pro současné načítání více modelů.
Vlastní konfigurační soubory Modelfile
- Zápis syntaxe Modelfile: příkazy FROM, PARAMETER, SYSTEM a TEMPLATE.
- Ladění parametrů jako teplota, hodnota top_p či trest za opakování výrazů.
- Navrhování systémových pokynů ovlivňujících chování modelu v konkrétním roli.
- Vytváření a publikování vlastních modelů do místního registru.
Integrace API
- Koncový bod /v1/chat/completions kompatibilní s OpenAI.
- Přenos odpovědí v reálném čase a práce v formátu JSON.
- Integrace do nástrojů LangChain, LlamaIndex i vlastních aplikací.
- Ochrana prostřednictvím autentizace a omezení počtu žádostí pomocí reverzního proxy serveru.
Optimalizace výkonu
- Dohoda velikosti kontextové paměti a správa vyrovnávací paměti KV Cache.
- Provádění dávkových operací inferenze a zvládání paralelních požadavků.
- Přidělování výpočetních vláken procesoru s ohledem na strukturu NUMA.
- Sledování využití grafické paměti a zatížení GPU.
Bezpečnost a dodržování předpisů
- Izolace sítí určených k poskytování modelů.
- Filtrace vstupních dat a kontrola výstupů z hlediska bezpečnosti.
- Zaznamenávání aktivit – ukládání všech požadavků a odpovědí modelů.
- Ověřování původu modelů prostřednictvím kontroly jejich hašovacích hodnot.
Požadavky
- Středně pokročilé znalosti správy systémů Linux a kontejnerů.
- Základní porozumění oblasti strojového učení a architektuře transformátorových modelů.
- Orientace v REST API a formátu JSON.
Cílová skupina
- Inženýři umělé inteligence a vývojáři, kteří nahrazují cloudová API pro velké jazykové modely.
- Organizace s citlivými daty, jež nemohou využít cloudové řešení.
- Vládní a obranné týmy potřebující izolované jazykové modely nepropojené s externími systémy.
14 Hodiny