Děkujeme za vaši dotaz! Jeden z našich pracovníků vás brzy kontaktuje.
Děkujeme za rezervaci! Jeden z našich pracovníků vás brzy kontaktuje.
Návrh Školení
Úvod do syntézy řeči a klonování hlasu
- Přehled textově-řečových systémů (TTS) a neuronové syntézy hlasu
- Klonování hlasu vs. generování řeči: oblasti využití a rozdíly
- Hlavní modely: Tacotron, WaveNet, FastSpeech, VITS
Práce s komerčními platformami
- Používání platforem ElevenLabs a Resemble AI
- Vytváření, klonování a úprava hlasů
- Přístup přes API a pracovní postupy pro textovou syntézu řeči
Práce s open-source nástroji
- Instalace a konfigurace nástroje Coqui TTS
- Trénování vlastních hlasů a správa datových sad
- Generování řeči s možností detailní kontroly (výška tónu, rychlost, emoce)
Příprava dat a správa sbírky hlasových vzorků
- Sběr a čištění hlasových nahrávek
- Segmentace, označování a zarovnávání textů s nahrávkami
- Etické získávání hlasových vzorků a dodržování souhlasu jednotlivců
Integrace do aplikací
- Vkládání systémů syntézy řeči do webových stránek a aplikací
- Konstrukce interaktivních hlasových systémů a chatbotů
- Generování syntetické řeči pro videa a hry
Hodnocení kvality a realismu vygenerované řeči
- Testy s použitím MOS (průměrného hodnotícího skóre) a testy srozumitelnosti
- Regulace expresivity a prozódie řeči
- Porovnávání latence, věrnosti přenosu i stupně realismu
Etické, právní a organizační aspekty
- Rizika spojená s deepfake technologiemi a odpovědné jejich využívání
- Otázky souhlasu jednotlivců, uvedení původu a autorských práv
- Regulace a vnitřní firemní směrnice
Shrnutí a další kroky
Požadavky
- Základní znalosti z oblasti strojového učení
- Seznámení s formáty audio souborů a nástroji na jejich úpravu
- Základní dovednosti v programování v jazyce Python
Pro koho je kurz určen
- Vývojáři a inženýři v oblasti umělé inteligence se zájmem o syntézu řeči
- Tvůrci obsahu a mediální technologové, kteří chtějí prozkoumat generování hlasu
- Výzkumné týmy budující personalizované nebo dynamické audio systémy
14 Hodiny