Strona głównaArtykułyData Science

Nauczanie z podkreśleniem та uczenie przez interakcję z środowiskiem

Uczenie poprzez interakcję z środowiskiem

mysimulator teamZaktualizowano — czerwiec 2026≈ 3 min czytania▶ Otwórz symulację

🎓 Podstawowe koncepty

Komponenty MDP: Proces decyzyjny Markowa – matematyczna ramka do modelowania problemów decyzyjnych sekwencyjnych.

Stan: aktualny stan środowiska.

Działanie: działania, które może wykonać agent.

Nagradza: nagroda otrzymana za wykonanie działania.

Polityka: strategia wyboru działań.

Funkcje wartościowe: szacują oczekiwany całkowity zysk z danego stanu lub pary stan-działanie.

V(s): Wartość stanu – oczekiwany zysk z danego stanu.

Q(s,a): Wartość działania – oczekiwany zysk z wykonania działania 'a' w stanie 's'.

Cel: znalezienie optimalnej polityki.

Exploracja vs Wykorzystywanie: równowaga między próbą nowych działań a wykorzystywaniem istniejących wiedzy do maksymalizacji zysku.

demo na żywo · powiązana symulacja● LIVE

🔧 Algorytmy

Q-Learning: algorytm uczenia z potwierdzeniem bez modelu, który naucza się optimalnej funkcji Q.

Koncept: nauczanie funkcji Q poprzez równanie Bellmana.

Formuła: Q(s,a) ← Q(s,a) + α[r + γ max Q(s',a') - Q(s,a)].

Wady: off-policy, proste.

Gradient Polityki: metoda naucznia polityk poprzez maksymizację oczekiwanej nagrody.

Metody: REINFORCE, Actor-Critic, PPO.

Wady: odpowiednie dla ciągłych działań i skomplikowanych polityk.

Głęboka Sieć Q (DQN): algorytm Q-Learning używający głębokiej sieci neuronowej do aproksymacji funkcji Q.

Techniki: powtórka doświadczeń, siatkówka celu.

Wady: skuteczne dla dużych przestrzeni stanów.

📚 Praktyczne przykłady

Przykład 1: Q-Learning dla Świata Sieci: Stwórz środowisko świata sieci. Zainicjuj tabelę Q. Trening agenta za pomocą Q-Learning. Użyj nauczonego polityki do nawigacji.

Przykład 2: DQN dla Atari: Przygotuj środowisko Atari. Trening DQN z powtarzalnością doświadczeń. Ocena wydajności na próbkach testowych.

Spróbuj to na żywo

Wszystko powyżej działa w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas działania modelu. Nie ma niczego do zainstalowania, nie ma niczego do przesyłania, cała модель istnieje w jednym zakładku.

Wypróbuj na żywo

Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Dimensionality Reduction: PCA, t-SNE & UMAP i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.

▶ Otwórz symulację Dimensionality Reduction: PCA, t-SNE & UMAP

Co znalazłeś?

Dodaj kroki odtworzenia (opcjonalnie)