Zkuste nás kontaktovat
 Doba trvání 28 hodiny

Návrh Školení

Úvod do posilování a agentic AI

  • Rozhodování za nejistoty a sekvenční plánování
  • Klíčové komponenty RL: agenti, prostředí, stavy a odměny
  • Role RL v adaptivních a agentic AI systémech

Markovy rozhodovací procesy (MDP)

  • Formální definice a vlastnosti MDP
  • Hodnotové funkce, Bellmanovy rovnice a dynamické programování
  • Hodnocení, zlepšování a iterace politiky

Model-free posilování

  • Monte Carlo a učení s časovými diferencemi (TD)
  • Q-learning a SARSA
  • Prakticky: implementace tabulkových metod RL v Pythonu

Hluboké posilování

  • Kombinace neuronových sítí a RL pro aproximaci funkcí
  • Hluboké Q-sítě (DQN) a experience replay
  • Architektury Actor-Critic a gradienty politiky
  • Prakticky: trénování agenta pomocí DQN a PPO s Stable-Baselines3

Strategie explorace a tvarování odměn

  • Vyvažování explorace a explotace (ε-greedy, UCB, metody entropie)
  • Navrhování funkcí odměn a vyhýbání se nežádoucím chováním
  • Tvarování odměn a curriculum learning

Pokročilé témata RL a rozhodování

  • Multi-agent posilování a kooperativní strategie
  • Hierarchické posilování a framework optionů
  • Offline RL a imitaci učení pro bezpečnější nasazení

Simulační prostředí a hodnocení

  • Použití OpenAI Gym a vlastních prostředí
  • Spojitý versus diskrétní akční prostory
  • Metric pro výkon, stabilitu a vzorkovací účinnost agentů

Integrace RL do agentic AI systémů

  • Kombinování uvažování a RL v hybridních agentních architekturách
  • Integrace posilování s agenty využívajícími nástroje
  • Operační úvahy pro škálování a nasazení

Závěrečný projekt

  • Navržení a implementace agenta posilování pro simulační úlohu
  • Analýza trénovacího výkonu a optimalizace hyperparametrů
  • Demonstrace adaptivního chování a rozhodování v agentic kontextu

Shrnutí a další kroky

Požadavky

  • Vysoce pokročilé znalosti programování v jazyce Python
  • Pevné pochopení konceptů strojového učení a hlubokého učení
  • Oznámenost s lineární algebra, pravděpodobností a základními optimalizačními metodami

Cílová skupina

  • Inženýři posilování a aplikovaní výzkumníci AI
  • Vývojáři robotiky a automatizace
  • Inženýrské týmy pracující na adaptivních a agentic AI systémech

Počet účastníků


Cena za účastníka

Reference (3)

Nadcházející kurzy

Související kategorie