Zkuste nás kontaktovat
 Doba trvání 21 hodiny

Návrh Školení

Úvod do multimodální AI a Ollama

  • Přehled multimodálního učení
  • Klíčové výzvy integrace videní a jazyka
  • Schopnosti a architektura Ollama

Nastavení prostředí Ollama

  • Instalace a konfigurace Ollama
  • Práce s lokálním nasazením modelů
  • Integrace Ollama s Pythonem a Jupyterem

Práce s multimodálními vstupy

  • Integrace textu a obrazů
  • Zařazení audio a strukturovaných dat
  • Navrhování pipeline pro preprocesování

Aplikace pro porozumění dokumentům

  • Extrakce strukturovaných informací z PDF a obrázků
  • Kombinace OCR se jazykovými modely
  • Budování inteligentních workflow pro analýzu dokumentů

Vizuální odpovídání na otázky (VQA)

  • Nastavení datových sad a benchmarků VQA
  • Trénování a hodnocení multimodálních modelů
  • Budování interaktivních aplikací VQA

Navrhování multimodálních agentů

  • Zásady návrhu agentů s multimodálním uvažováním
  • Kombinace vnímání, jazyka a akcí
  • Nasazení agentů pro reálné použití

Pokročilá integrace a optimalizace

  • Ladění multimodálních modelů pomocí Ollama
  • Optimalizace výkonu inferencí
  • Zvažení škálovatelnosti a nasazení

Shrnutí a další kroky

Požadavky

  • Hluboké pochopení konceptů machine learningu
  • Znalost hlubokých učících se frameworků, jako jsou PyTorch nebo TensorFlow
  • Znalost zpracování přirozeného jazyka a počítačového videní

Cílová skupina

  • Inženýři machine learningu
  • Výzkumníci AI
  • Vývojáři produktů integrující vizuální a textové workflow

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie