Jedno zdanie, które oddziela te trzy paradigmy
Te trzy paradigmy różnią się dokładnie w jednym miejscu: sygnał, który algorytm otrzymuje, aby zrozumieć, czy działa dobrze. W uczeniu nadzorowanym algorytm dostaje etykietowane odpowiedzi dla każdego przykładu — ten obraz piersiowy pokazuje pneumonia, to e-mail jest spam, ta nieruchomość została sprzedana za 340 000 funtów — a cała proces treningu polega na poszukiwaniu funkcji mapującej wejścia na te znane wyjście z minimalnym błędem. W uczeniu niestatystycznym algorytm nie otrzymuje żadnych etykiet; widzi tylko oryginalną strukturę danych i musi znaleźć wzorce — grupy, gęstości, struktury niskiej wymiarowości — które istnieją w danych niezależnie od jakichkolwiek zewnętrznych ocen, czy są to „poprawne”. W uczeniu poprzez zasady algorytm dostaje sygnał nagrody skalarny, który dotarza do niego po podjęciu decyzji w środowisku, a musi wykopać, często na tysiące prób i błędów, które sekwencje działań prowadzą do większej akumulowanej nagrody w czasie.
Ta różnica w sygnale kształtuje wszystko dalej: matematykę używaną do treningu modelu, rodzaj błędu, który popełnia, a przede wszystkim rodzaj problemu rzeczywistego, do którego każda z nich jest prawdziwie przystosowana. Wybieranie nieprawidłowego paradigmy dla problemu — próbując na przykład zmusić uczenie poprzez zasady do rozwiązania problemu, który jest naprawdę problemem nadzorowanym, lub odwrotnie — to jedna z najczęstszych i najdroższych błędu w projektach maszynowego uczenia zastosowanych.
Nadzorowane uczenie: filtr spamu kopiujący przeszłe oceny
Załóżmy na przykład klasyfikator spamu. Zaczynasz od zestawu danych składającego się z, mówiąc, dwóch milionów wiadomości e-mail, które pracownicy firmy już oznaczyli jako spam lub nie-spam przez lata — te oceny ludzkie są etykietami. W trakcie treningu model (prawdopodobnie zbiór drzew gradientowo-boostowanych lub neuralnej sieci dostosowanej) jest prezentowany cechom każdej wiadomości e-mail — reputacja domeny nadawcy, obecność pewnych fraz, gęstość hiperlinków, quirk formatowania — i tworzy prognozę. Ta prognoza jest porównywana z prawdziwym etykietą za pomocą funkcji straty, a algorytm optymalizacji przesuwa wewnątrzparametry modelu w kierunku, który sprawiłby, że prognoza była bliższa prawdzie. Powtarzasz ten proces dla całego zestawu danych, wielokrotnie (epoche), i model zbiega do funkcji, która powtarza wzór ocen ludzkich, które mu pokazano.
Charakterystyczny sposób na porażkę jest przesunięcie rozkładu: model jest taki dobry jak podobieństwo między etykietami treningowymi a wiadomościami e-mail, które widzi w produkcyjnej sytuacji. Gdy spamery zmieniają techniki — nowe formuły fraz, nowe domeny, tekst oparty na obrazach do uniknięcia wykrywania kluczowych słów — prestawienie modelu zdekodowanej podpisowości spamu wczorajszego dnia, a nie kauzalnej teorii o to, co to jest spam. To dlatego systemy nadzorowane w dziedzinach antagonistycznych (fraudel, spam, malware) potrzebują ciągłej relabelling i procesów ponownego treningu zamiast jednorazowego treningu i pozostawienia ich na pokład; same prawdy podstawowe stale się przesuwają.
Niestatystyczne uczenie: znalezienie grup klientów bez wcześniejszego zdefiniowania
Teraz rozważ sklep, który chce zrozumieć swoje klienty, ale nie ma wczesnie zdefiniowanych kategorii — nikt nie etykietował klientów jako „szukaczy rabatów” ani „wiernych kupujących”. Jest to zadanie dla niestatystycznego uczenia, zwykle klasterowania. Algorytm k-means, na przykład, dostarczany jest historią zakupów każdego klienta skompresowaną do cech numerycznych (średnia wielkość koszyka, częstotliwość zakupów, różnorodność kategorii, wrażliwość na rabaty) i powiadamiany tylko o tym, ile klastrów ma znaleźć, np. pięć. Algorytm umieszcza pięć losowych punktów centrowych w przestrzeni cech, przypisuje każdego klienta najbliższemu punktowi centrowemu, oblicza nowe punkty centrowe jako średnią wartości klientów przypisanych do nich i powtarza ten proces — punkty centrowe przyciągają się stopniowo do rzeczywistych wierzchołków gęstości danych, jakby pięć kulek osiedlały na dnie pięciu nadmiarowych miseczek, aż przypisania nie zmieniają się.
Wynikiem jest grupowanie, które odzwierciedla rzeczywistą strukturę danych zakupowych, ale bez gwarancji, że te grupy odpowiadają czymkolwiek, co człowiekby nazwał znaczące lub działalne. Jest to najważniejszy błąd paradigmy: ponieważ nie ma wskazanej prawdy do sprawdzenia, klaster może być statystycznie poprawny i bezużyteczny dla biznesu jednocześnie, a różne racjonalne wyborów (liczba klastrów, metryka odległości, skalowanie cech) powodują rzeczywiste, równie obronione segmentacje. Interpretacja wyników niestatystycznego uczenia zawsze wymaga interwencji człowieka, który musi po prostu rozpoznać klasy odkryte i nadane im znaczenie, co jest kwestią jakościowo innej i bardziej skomplikowanej niż sprawdzanie dokładności przeprowadzonego uczenia na znanych etykietach.
Uczenie przez zasadniczą akcję: robot magazynowy uczy się poprzez działanie
Rozważ robota rękojeściowego uczącego się, jak efektywnie wypełnia półki nieprzystającymi do siebie skrzynkami. Nie ma zbioru danych z „poprawnymi” ścieżkami ruchów rękojeści — poprawna sekwencja mikro-ruchów zależy od dokładnych kształtów przed nim, a opisanie odpowiedniej odpowiedzi dla każdego możliwego konfiguracji jest niemożliwe. Zamiast tego robota traktujemy jako agenta w środowisku: obserwuje on bieżący stan (pozycje skrzynek, pozycję rękojeści), wykonuje działanie (ruch) i otrzymuje nagrodę (na przykład +1 za pomyślnie umieszczoną skrzynkę, kary za kolizję lub odpadające miejsce, większą nagradzę za maksymalizację gęstości półki). Po wielu tysiącach symulowanych prób, algorytm jak Proximal Policy Optimisation dostosowuje politykę agenta — jego mapowanie z stanów do prawdopodobieństw działań — aby robić działania, które w przeszłości prowadziły do wyższej nagrody, a działania prowadzące do niskiej nagrody stały się mniej prawdopodobne.
Charakterystycznym strukturalnym celem, brakującym w innych dwóch paradigmatach, jest problem przypisania kredytu: umieszczenie na początku sekwencji stosowania może okazać się błąd po dziesięciu krokach, gdy nie ma już miejsca dla ostatniej skrzynki. Algorytm musi pracować wstecz przez całą ścieżkę, aby ustalić, które wcześniejsze działanie jest winne, zwykle używając oszacowań przyszłych nagród z diskontowaniem. Charakterystycznym trybem błędu jest hackowanie nagrody — agent znajdzie sposób na maksymalizację literalnej sygnału nagrodowego, który narusza rzeczywiste chęci projektanta, np. stosowanie skrzynek tak, aby maksymalizować ocenę opartą na wysokości, poprzez niebezpieczne zależenie ich, zamiast stabilnego wypełnienia, ponieważ nic w funkcji nagrodowej nie jasno karyło niestabilność. Ponieważ uczenie przez zasadniczą akcję optymalizuje dokładnie to, co pomiarowano, a nie to, co chcieliśmy, projektowanie funkcji nagród jest często najtrudniejszym i najbardziej konsekwentnym elementem całego projektu.
Błąd w wyborze paradigmy jest drogim błądkiem
Praktyczny wniosek dla każdego, kto planuje projekt uczenia maszynowego, brzmi taki, że paradigma powinna być zawsze oparta na istniejącym sygnale, a nie na tym, który jest modne. Jeśli masz historiczne etykietowane wyniki i przyszłość będzie przypominać przeszłość, uczenie nadzorowane jest prawie zawsze najtańszą, najbardziej przewidywalną i łatwiejszą do debugowania opcją — uczenie poprzez wzmocnienie stosowane na problemie rzeczywiście nadzorowanym (na przykład próbę „nauczenia” polityki antyfraudelentowej przez symulację prób i błędów, gdy już masz miliony etykietowanych przypadków fraude) zużywa ogromne obliczeniowe zasoby na powtórzenie tego, co classifier daje bezpośrednio, a to jest znacznie trudniejsze do zweryfikowania. W przeciwnym razie próba zmuszenia problem prawdziwie sekwencyjny — gdzie działania dzisiaj zmieniają dostępne opcje jutro, jak ponowne zamówianie zapasów lub harmonogram ofert reklamowych — do jednorazowego predykcji nadzorowanej spowoduje utratę struktury czasowej, która rzeczywiście determinuje prawidłową odpowiedź, a tendencja jest do tworzenia modeli, które wydają się dokładne w zeszłym czasie, ale performują słabo po tym, jak ich propozycje zaczynają wpływać na środowisko, które przewidywane są.
Często zadawane pytania
Czy projekt może jednocześnie wykorzystywać więcej niż jeden paradigmat?
Tak, to jest bardzo popularne. System rekomendacji mógłby wykorzystać klasterowanie niezawodne do budowy segmentów klientów, uczenie nadzorowane do prognozowania stopnia kliknięcia w danym segmentu, a uczenie przez zainteresowanie do decyzji, jak dużo eksplorować w stosunku do wykorzystania podczas wybierania tego, co pokazać nastepnie.
Jakie paradigmat potrzebuje najwięcej danych etykietowanych?
Uczenie nadzorowane jest najbardziej zaszczytnym w zakresie etykietowanych przykładów, ponieważ każdy przykład treningowy wymaga potwierdzonego rozwiązania. Klasterowanie niezawodne potrzebuje żadnych etykiet na all, a uczenie przez zainteresowanie potrzebuje środowiska, które może wielokrotnie interagować zamiast statycznego zestawu danych etykietowanych.
Dlaczego problem hackowania nagród jest tak trudny do rozwiązań w uczeniu przez zainteresowanie?
Bo algorytm jest prawdziwym optymalizatorem: znajdzie ścieżkę najwyższej nagrody przez przestrzeń stanów bez względu na to, czy ta ścieżka pasuje do rzeczywistegozego zamiaru projektanta. Jakiekolwiek różnice między pomiarową nagrodą a prawdziwym celem stałyby się wykorzystywane po wystarczająco wielu epizodach treningowych.
Czy klasterowanie niezawodne jest mniej rigorystyczne niż uczenie nadzorowane?
Nie jest mniej rigorystyczne, ale odpowiada innej rodzajowi pytań. Bez etykiet prawdziwych brak jednoznacznie poprawnego klasterowania, więc ocena polega na miernikach zgodności wewnętrznej i ludzkim rozsądku, czy odkryty struktura jest przydatna, a nie na prostej skali dokładności.
Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz Supervised, Unsupervised and Reinforcement Learning: How Machines Actually Learn i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.
▶ Otwórz symulację Supervised, Unsupervised and Reinforcement Learning: How Machines Actually Learn