Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Přehled technologií rozpoznávání řeči
- Historie a vývoj rozpoznávání řeči
- Akustické modely, jazykové modely a dekodování
- Moderní architektury: RNN, transformery a Whisper
Předzpracování audio a základy přepisu
- Práce s formáty audio a vzorkovacími frekvencemi
- Čištění, stříhání a segmentace audio
- Generování textu z audio: reálný čas vs. dávkové zpracování
Praktická práce s Whisper a dalšími API
- Instalace a použití OpenAI Whisper
- Volání cloudových API (Google, Azure) pro přepis
- Srovnání výkonu, latence a nákladů
Jazyk, přízvuky a adaptace na doménu
- Práce s více jazyky a přízvuky
- Vlastní slovníky a odolnost proti hluku
- Zpracování právního, lékařského nebo technického jazyka
Formátování výstupu a integrace
- Přidávání časových značek, interpunkce a etiket mluvčích
- Export do formátů text, SRT nebo JSON
- Integrace přepisů do aplikací nebo databází
Laboratorní cvičení pro implementaci use case
- Přepis schůzek, interview nebo podcastů
- Systémy hlasových příkazů (voice-to-text)
- Nadpisy v reálném čase pro video/audio streamy
Vyhodnocení, omezení a etika
- Metriky přesnosti a benchmarking modelů
- Průnik a férovost v modelech řeči
- Otázky soukromí a souladu s předpisy
Shrnutí a další kroky
Požadavky
- Znalost obecných konceptů AI a strojového učení
- Oznámenost s formáty a nástroji pro audio nebo média soubory
Cílová skupina
- Data scientisti a AI inženýři pracující s hlasovými daty
- Vývojáři softwaru vytvářející aplikace založené na přepisu
- Organizace zkoumající rozpoznávání řeči pro automatizaci
14 Hodiny