Zkuste nás kontaktovat

Návrh Školení

Přehled technologií rozpoznávání řeči

  • Historie a vývoj rozpoznávání řeči
  • Akustické modely, jazykové modely a dekodování
  • Moderní architektury: RNN, transformery a Whisper

Předzpracování audio a základy přepisu

  • Práce s formáty audio a vzorkovacími frekvencemi
  • Čištění, stříhání a segmentace audio
  • Generování textu z audio: reálný čas vs. dávkové zpracování

Praktická práce s Whisper a dalšími API

  • Instalace a použití OpenAI Whisper
  • Volání cloudových API (Google, Azure) pro přepis
  • Srovnání výkonu, latence a nákladů

Jazyk, přízvuky a adaptace na doménu

  • Práce s více jazyky a přízvuky
  • Vlastní slovníky a odolnost proti hluku
  • Zpracování právního, lékařského nebo technického jazyka

Formátování výstupu a integrace

  • Přidávání časových značek, interpunkce a etiket mluvčích
  • Export do formátů text, SRT nebo JSON
  • Integrace přepisů do aplikací nebo databází

Laboratorní cvičení pro implementaci use case

  • Přepis schůzek, interview nebo podcastů
  • Systémy hlasových příkazů (voice-to-text)
  • Nadpisy v reálném čase pro video/audio streamy

Vyhodnocení, omezení a etika

  • Metriky přesnosti a benchmarking modelů
  • Průnik a férovost v modelech řeči
  • Otázky soukromí a souladu s předpisy

Shrnutí a další kroky

Požadavky

  • Znalost obecných konceptů AI a strojového učení
  • Oznámenost s formáty a nástroji pro audio nebo média soubory

Cílová skupina

  • Data scientisti a AI inženýři pracující s hlasovými daty
  • Vývojáři softwaru vytvářející aplikace založené na přepisu
  • Organizace zkoumající rozpoznávání řeči pro automatizaci
 14 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie