Zkuste nás kontaktovat

Návrh Školení

Úvod do multimodální umělé inteligence a Ollamy

  • Přehled multimodálního učení
  • Hlavní výzvy při integraci obrazu a jazyka
  • Možnosti a architektura Ollamy

Nastavení prostředí pro Ollamu

  • Instalace a konfigurace Ollamy
  • Pracovní postupy při lokálním nasazení modelů
  • Integrace Ollamy s Pythonem a Jupyterm

Pracovní s multimodálními vstupy

  • Kombinace textu a obrazů
  • Incorporace zvuku a strukturovaných dat
  • Návrh předzpracovatelských procesů

Aplikace na rozpoznávání dokumentů

  • Extrahování strukturovaných informací z PDF a obrazových souborů
  • Spojení technologií OCR s jazykovými modely
  • Tvorba inteligentních systémů na analýzu dokumentů

Vizuální odpovídání na otázky (VQA)

  • Příprava datových sad a testovacích metrik pro VQA
  • Trenování a vyhodnocování multimodálních modelů
  • Vytváření interaktivních aplikací využívajících VQA

Návrh multimodálních agentů

  • Zásady navrhování agentů s možností uvažování napříč modalitymi
  • Kombinace vnímání, jazyka a akcí
  • Nasazení takových agentů do praxe

Pokročilá integrace a optimalizace

  • Ladění multimodálních modelů pomocí Ollamy
  • Optimalizace výkonu při inferenci
  • Aspekty škálovatelnosti a nasazení řešení

Shrnutí a další kroky

Požadavky

  • Dobrá znalost konceptů strojového učení
  • Zkušenosti s frameworky pro hluboké učení, jako jsou PyTorch nebo TensorFlow
  • Orientace v oblasti zpracování přirozeného jazyka a počítačového vidění

Cílová skupina

  • Inženýři strojového učení
  • Výzkumníci v oblasti umělé inteligence
  • Vývojáři produktů pracující s kombinací vizuálních a textových dat
 21 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie