UCZENIE SIŁĄ W SZAFARZTWE I MEDICYNIE
Ta sekcja bada zastosowanie uczenia siłą w sektorach szafarztwa i medycyny.
Przedstawia tagi stosowane do dalszej eksploracji, w tym techniki uczenia maszynowego, ścieżki kariery w dziedzinie nauk danych oraz rozwój ekspertyz AI.
Kluczowe koncepty: stan i działania
W uczeniu siłą środowisko jest przedstawiane jako zestaw możliwych stanie. Ta „S” reprezentuje wszystkie możliwe scenariusze, w których agent może się znaleźć.
Podobnie, działania agenta są również zdefiniowane w zestawie – „A”. P(s' | s, a) opisuje prawdopodobieństwo przejścia do nowego stanu „s” po podjęciu działania „a” w stanie „s”.
Historyczny kontekst i ewolucja
Podstawy uczenia przez zaszczytanie się przypisują się nieco dalej w czasie, korzeniując się w psychologicznych zasadach, takich jak prawo efektu Edwarda Thorndikego. To prawo stwierdza, że zachowania, które są towarzyszone pozytywnymi konsekwencjami, są bardziej prawdopodobne do powtórzenia.
Formalizacja jako oddzielna technika uczenia maszynowego rozpoczęła się w późnych latach 80. i początku lat 90., głównie z powodu przerwania Richarda S. Suttona. Wczesne metody opierały się na Q-tabelach, ale problemy skalowalności prowadziły do przełomów zastosowując aproksymację funkcji.
Często zadawane pytania
Czym jest Funkcja wartości w uczeniu z potwierdzeniami?
Funkcja wartości estymuje oczekiwany akumulowany nagrodę, którą może osiągnąć agent, pozostając w danym stanie i kierując się określonymi politykami.
Moglibyście opisać różne rodzaje algorytmów uczenia z potwierdzeniami?
Algorytmy uczenia z potwierdzeniami w ogólności podzielone są na dwie kategorie: Model-Based RL (uczenie bazujące na modelu) i Model-Free RL (model-free RL, uczenie bez modelu), każda z nich stosując różne podejścia do nauki.
Czym jest uczenie z potwierdzeniami bazujące na modelu, a jak się różni od innych metod?
Uczenie z potwierdzeniami bazujące na modelu polega na tym, że agent uczy się modelu środowiska, co pozwala mu prognozować przyszłe wyniki i planować odpowiednio. Prominentnym przykładem jest Dyna-Q.
Czym jest uczenie z potwierdzeniami bez modelu, a jak działa?
Uczenie z potwierdzeniami bez modelu bezpośrednio naucza się funkcji Q lub polityki bez budowania explikowego modelu środowiska. Popularne przykłady to Q-learning i SARSA.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Decision Tree Live i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Decision Tree Live