Zkuste nás kontaktovat
 Doba trvání 14 hodiny

Návrh Školení

Úvod do multimodality Gemini 3

  • Možnosti napříč textem, obrázky, audiem a videem
  • Výběr modelu a přehled koncových bodů
  • Klíčové koncepty multimodálního uvažování

Práce s textem a strukturovanými vstupy

  • Strategie promptování pro generování textu
  • Metadata, okna kontextu a embeddingy
  • Textová orchesterace multimodálních úkolů

Pochopení obrazů a vizuální pracovní procesy

  • Analýza a interpretace obrázků pomocí Gemini 3
  • Vytváření nástrojů pro vizuální vyhledávání a označování
  • Navazování interakcí obrázek-na-text a text-na-obrázek

Zpracování audio vstupů

  • Pracovní procesy pro rozpoznávání řeči a přepisování
  • Detekce a interpretace zvukových událostí
  • Integrace audio s textovými a vizuálními vstupy

Videointeligence a analýza scén

  • Rozhodování video po snímcích a kontinuální video analýza
  • Vytváření nástrojů pro shrnutí a extrakci závažných momentů
  • Automatizace a pracovní procesy obsahu založené na videu

Navrhování architektur multimodálních aplikací

  • Kombinace více typů vstupů v jediném potoce
  • Zvažování latence, nákladů a výpočetního výkonu
  • Nejlepší postupy pro škálovatelné multimodální systémy

Prototypování multimodálních aplikací

  • Praktické vytvoření multimodálních prototypů
  • Rychlá iterace pomocí inženýrství promptů
  • Testování a doladování uživatelských zážitků

Nasazení multimodálních řešení

  • Strategie nasazení a nastavení prostředí
  • Monitorování výkonu v reálném světě
  • Zvažování bezpečnosti a souladu s předpisy

Shrnutí a další kroky

Požadavky

  • Rozumění moderním konceptům umělé inteligence
  • Zkušenosti s jazykem Python nebo JavaScript
  • Znalost REST API

Cílová skupina

  • Designéři
  • Tvůrci obsahu
  • Teknické týmy na produktových stranách

Počet účastníků


Cena za účastníka

Reference (1)

Nadcházející kurzy

Související kategorie