Zkuste nás kontaktovat

Návrh Školení

Úvod do metody Reinforcement Learning from Human Feedback (RLHF)

  • Co je RLHF a proč je důležitá
  • Srovnání s metodami doladění pomocí pozorování
  • Použití RLHF v současných systémech umělé inteligence

Modelování odměňovacích funkcí na základě lidské zpětné vazby

  • Shromažďování a organizace lidské zpětné vazby
  • Tvorba a trénování odměňovacích modelů
  • Hodnocení efektivity těchto modelů

Trénování pomocí algoritmu Proximal Policy Optimization (PPO)

  • Přehled PPO algoritmů v kontextu RLHF
  • Implementace metody PPO s využitím odměňovacích modelů
  • Postupné a bezpečné doladění modelů

Praktické doladění jazykových modelů<\/p>

  • Příprava dat pro procesy RLHF
  • Samostatné doladění malého jazykového modelu pomocí technik RLHF
  • Běžné výzvy a možnosti jejich řešení

Škálování procesů RLHF pro produkční nasazení<\/p>

  • Přístup k hardwarovému vybavení a výpočetním prostředkům
  • Kontrola kvality a průběžná zpětná vazba od uživatelů<\/li>
  • Doporučené postupy při nasazení a údržbě systémů

Etické aspekty a snižování předpojatosti<\/p>

  • Ochrana proti etickým rizikům vzniklým z lidské zpětné vazby
  • Detekce a korekce případných předsudků v modelech<\/li>
  • Zajištění souladu modelů s etickými standardy i bezpečností výstupů

Případové studie a reálné ukázky využití<\/p>

  • Příklad: Doladění ChatGPT pomocí RLHF<\/li>
  • Další úspěšné nasazení metody RLHF<\/li>
  • Zkušenosti a poznatky z praxe v daném odvětví

Shrnutí a další směřování kurzu

Požadavky

  • Znalost základů učení se na základě pozorování i metodám posilovacího učení
  • Zkušenosti s doladěním modelů a práce s architekturami neuronových sítí
  • Ovládání programovacího jazyka Python a nástrojů pro hluboké učení (např. TensorFlow, PyTorch)

Určené publikum

  • Inženýři strojového učení
  • Výzkumníci v oblasti AI
 14 Hodiny

Počet účastníků


Cena za účastníka

Nadcházející kurzy

Související kategorie