Zkuste nás kontaktovat

Návrh Školení

1. Úvod do hlubokého učení s posilováním

  • Co je to posilovací učení?
  • Rozdíly mezi učením s dohledem, bez dohledu a s posilováním
  • Aplikace DRL v roce 2025 – robotika, zdravotnictví, finance a logistika
  • Pojetí interakcí mezi agentem a prostředím

2. Základy posilovacího učení

  • Markovské rozhodovací procesy (MDP)
  • Stav, akce, odměna, politika a funkce hodnoty
  • Rozdíl mezi průzkumem prostředí a využitím dosažených znalostí
  • Metody Monte Carlo a učení na základě časových rozdílů (Temporal-Difference Learning)

3. Implementace základních algoritmů RL

  • Tabulkové metody: dynamické programování, vyhodnocování politik a iterativní procesy
  • Algoritmy Q-Learning a SARSA
  • Strategie průzkumu typu epsilon-greedy s postupným snižováním hodnoty epsilon
  • Vytváření prostředí pro učení pomocí knihovny OpenAI Gymnasium

4. Přechod k hlubokému učení s posilováním

  • Limitace tabulkových metod
  • Využití neuronových sítí k aproximaci funkcí
  • Architektura a pracovní postupy modelu Deep Q-Network (DQN)
  • Mechanismy opakovaného využívání zkušeností a cílových sítí

5. Pokročilé algoritmy DRL

  • Rozšířený DQN, Dueling DQN a metoda upřednostňování opakovaně využitých zkušeností
  • Metody gradientů politiky: algoritmus REINFORCE
  • Architektury typu Actor-Critic – např. A2C a A3C
  • Technika Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Práce s prostředími majícími spojitý prostor akcí

  • Specifické výzvy při řízení v reálném čase
  • Využití algoritmu DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Praktické nástroje a frameworky

  • Práce s knihovnami Stable-Baselines3 a Ray RLlib
  • Logování a monitorování procesu tréninku pomocí TensorBoard
  • Optimalizace hyperparametrů u modelů DRL

8. Tvorba odměn a návrh prostředí

  • Formování odměn a vyvažování penalizací
  • Koncepty transferu učení ze simulace do skutečného světa
  • Vytváření vlastních prostředí pomocí Gymnasium

9. Prostředí s částečně nekompletními informacemi a generalizace

  • Řešení situací, kdy informace o stavu jsou nedostatečné (POMDP)
  • Využití paměťových prvků na bázi LSTM a RNN
  • Zlepšení odolnosti a schopnosti generalizace agentů

10. Teorie her a víceagentní učení s posilováním

  • Základy prostředí obsahujících více agentů
  • Rozdíly mezi spoluprací a konkurencí mezi agenty
  • Aplikace v oblasti konfrontačního trénování a optimalizace strategií

11. Případové studie a praktické aplikace

  • Simulace samořiditelných vozidel
  • Dynamické cenotvorby a strategie finančního obchodování
  • Využití v robotice a průmyslové automatizaci

12. Diagnostika problémů a optimalizace výkonu

  • Identifikace nestabilního tréninkového procesu
  • Zvládání nedostatečné četnosti udělování odměn a případů nadpřizpůsobení modelu
  • Škálování modelů DRL na GPU a v distribuovaných systémech

13. Shrnutí a další směřování

  • Přehled architektur DRL a klíčových algoritmů
  • Současné trendy v oboru a výzkumné směry – například RLHF a hybridní modely
  • Doporučené zdroje informací a studijní materiály

Požadavky

  • Znalosti programování v Pythonu
  • Pochopení základů matematické analýzy a lineární algebry
  • Základní znalosti pravděpodobnosti a statistiky
  • Praktické zkušenosti s tvorbou modelů strojového učení pomocí Pythonu, knihoven NumPy či TensorFlow/PyTorch

Cílová skupina

  • Vývojáři se zájmem o umělou inteligenci a chytré systémy
  • Datoví analytici, kteří se hlouběji zabývají rámci posilovacího učení
  • Inženýři strojového učení pracující s autonomními systémy
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (3)

Nadcházející kurzy

Související kategorie