Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Doba trvání 14 hodiny
Návrh Školení
Úvod do multimodality Gemini 3
- Možnosti napříč textem, obrázky, audiem a videem
- Výběr modelu a přehled koncových bodů
- Klíčové koncepty multimodálního uvažování
Práce s textem a strukturovanými vstupy
- Strategie promptování pro generování textu
- Metadata, okna kontextu a embeddingy
- Textová orchesterace multimodálních úkolů
Pochopení obrazů a vizuální pracovní procesy
- Analýza a interpretace obrázků pomocí Gemini 3
- Vytváření nástrojů pro vizuální vyhledávání a označování
- Navazování interakcí obrázek-na-text a text-na-obrázek
Zpracování audio vstupů
- Pracovní procesy pro rozpoznávání řeči a přepisování
- Detekce a interpretace zvukových událostí
- Integrace audio s textovými a vizuálními vstupy
Videointeligence a analýza scén
- Rozhodování video po snímcích a kontinuální video analýza
- Vytváření nástrojů pro shrnutí a extrakci závažných momentů
- Automatizace a pracovní procesy obsahu založené na videu
Navrhování architektur multimodálních aplikací
- Kombinace více typů vstupů v jediném potoce
- Zvažování latence, nákladů a výpočetního výkonu
- Nejlepší postupy pro škálovatelné multimodální systémy
Prototypování multimodálních aplikací
- Praktické vytvoření multimodálních prototypů
- Rychlá iterace pomocí inženýrství promptů
- Testování a doladování uživatelských zážitků
Nasazení multimodálních řešení
- Strategie nasazení a nastavení prostředí
- Monitorování výkonu v reálném světě
- Zvažování bezpečnosti a souladu s předpisy
Shrnutí a další kroky
Požadavky
- Rozumění moderním konceptům umělé inteligence
- Zkušenosti s jazykem Python nebo JavaScript
- Znalost REST API
Cílová skupina
- Designéři
- Tvůrci obsahu
- Teknické týmy na produktových stranách
Reference (1)
Plyn, atmosféra a téma prezentace
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurz - Google Gemini AI for Data Analysis
Přeloženo strojem