🎓 Podstawowe koncepty
Komponenty MDP: Proces decyzyjny Markowa – matematyczna ramka do modelowania problemów decyzyjnych sekwencyjnych.
Stan: aktualny stan środowiska.
Działanie: działania, które może wykonać agent.
Nagradza: nagroda otrzymana za wykonanie działania.
Polityka: strategia wyboru działań.
Funkcje wartościowe: szacują oczekiwany całkowity zysk z danego stanu lub pary stan-działanie.
V(s): Wartość stanu – oczekiwany zysk z danego stanu.
Q(s,a): Wartość działania – oczekiwany zysk z wykonania działania 'a' w stanie 's'.
Cel: znalezienie optimalnej polityki.
Exploracja vs Wykorzystywanie: równowaga między próbą nowych działań a wykorzystywaniem istniejących wiedzy do maksymalizacji zysku.
🔧 Algorytmy
Q-Learning: algorytm uczenia z potwierdzeniem bez modelu, który naucza się optimalnej funkcji Q.
Koncept: nauczanie funkcji Q poprzez równanie Bellmana.
Formuła: Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)].
Wady: off-policy, proste.
Gradient Polityki: metoda naucznia polityk poprzez maksymizację oczekiwanej nagrody.
Metody: REINFORCE, Actor-Critic, PPO.
Wady: odpowiednie dla ciągłych działań i skomplikowanych polityk.
Głęboka Sieć Q (DQN): algorytm Q-Learning używający głębokiej sieci neuronowej do aproksymacji funkcji Q.
Techniki: powtórka doświadczeń, siatkówka celu.
Wady: skuteczne dla dużych przestrzeni stanów.
📚 Praktyczne przykłady
Przykład 1: Q-Learning dla Świata Sieci: Stwórz środowisko świata sieci. Zainicjuj tabelę Q. Trening agenta za pomocą Q-Learning. Użyj nauczonego polityki do nawigacji.
Przykład 2: DQN dla Atari: Przygotuj środowisko Atari. Trening DQN z powtarzalnością doświadczeń. Ocena wydajności na próbkach testowych.
Spróbuj to na żywo
Wszystko powyżej działa w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas działania modelu. Nie ma niczego do zainstalowania, nie ma niczego do przesyłania, cała модель istnieje w jednym zakładku.
▶ Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.