Problem z prognozowaniem depozytu ze ukrytym przyspieszeniem
Znany zestaw danych pochodzący od portugalskiego banku handlowego rejestruje wyniki około 41 000 wywołań telefonicznych zewnetrznych, każda próbka to próba sprzedaży depozytu na termin. Zadanie wygląda jak typowy problem klasyfikacji binarnej: podane wszystkie informacje banku o klientce i kampanii, prognozować, czy kolumna y skończy się na 'tak' lub 'nie'. Dostępnych jest około 21 pole, rozdzielonych na trzy naturalne grupy — atrybuty klienta takie jak wiek, zawód, stan małżeński i istniejące kredyty; szczegóły kontaktu kampanii takie jak kanał komunikacji, miesiąc i ile razy osoba została już dzwoniona; oraz kilka wskaźników makroekonomicznych opisujących stan gospodarki na czas wywołania.
W grupie szczegółów kontaktowych kampanii ukryte jest pole o nazwie trwałość: długość, w sekundach, ostatniego telefonu. Okazuje się, że to jedno z najmocniejszych pojedynczych przewidywaczy wyniku 'tak'. Długie rozmowy są skorelowane enormnie z sprzedażą, ponieważ rozmowa kończąca się w sekundę prawie zawsze oznacza odłączenie się od telefonu, podczas gdy rozmowa trwająca kilka minut zwykle oznacza, że klient pozostawał na lini to zadaje pytania dotyczące produktu. Jakiekolwiek model dany tą cechę uczy się radośnie tej zasady i uzyskuje doskonałe dokładności oraz oceny ROC-AUC na danych wyprowadzonych.
Dlaczego najpotężniejszy przewidywacz nadal musi zostać usunięty
Czynnik polega na timingu zamiast statystyk. Długość rozmowy jest znana tylko po tym, jak zakończy się wywołanie. Model przeznaczony do pomocy zarządcy centrum telefonicznego w decyzji o tym, kogo dzwonić lub w jakim porządku, potrzebuje swoich wejść, które są znane przed samym wywołaniem. Podawanie mu długości rozmowy jest formą przepływu danych: informacje na temat przyszłego wyniku śmiało wprowadzające się do wejścia poprzez cechę, która w produkcji nie będzie istniała podczas przewidywania.
To konkretny i powszechny rodzaj przepływu danych – czasami nazywany 'po-wyniku' lub 'dolną' cechą. Diferencja od bardziej oczywistych przepływów (np. włączenie samego etykiety, czy jego proxy obliczone po faktu) polega głównie na tym, jak bezpieczna wygląda ta cecha. Długość rozmowy jest perfectly ordinary integer column siedząca obok kampanii i wcześniejszych, a nic w schemacie nie oznacza jej jako zagrożonej. Jedynym sposobem na zauważenie jej jest rozważanie przyczynowo-czasowego porządku wydarzeń: czy wartość istnieje w chwili, gdy naprawdę potrzebujemy podjąć przewidywanie? Dla długości rozmowy odpowiedź jest jasno ujemna. Zatem odpowiednia praktyka na tej bazie danych polega na całkowitej usunięciu jej przed treningiem modelu, który będzie wdrożony, mimo że to spowalnia obecnie najważniejsze metryki.
Co rzeczywiście przewiduje 'tak' po usunięciu skrótu
Bez uwzględnienia trwania, rangi ważności cech i analiza SHAP (SHapley Additive exPlanations) na modelu gradient-boostowanym wskazują na inny, bardziej użyteczny zestaw czynników. Indeksy makroekonomiczne dominują: trzy miesięczna taux Euribor, liczba osób zatrudnionych na całym terenie i stopa zmian w zatrudnieniu mają najbardziej wyjaśniającą wagę. To ma intuicyjny sens — lokata terminowa jest podstawowym konkurencja za pieniądze klienta z innymi możliwościami korzystania z gotówki, a kiedy się zmieniają stopy procentowe i ogólny stan gospodarki, relatywna atrakcyjność zaszywania pieniędzy w lokacie zmienia się zgodnie z nimi. Zazwyczaj wykresy podsumowujące SHAP na tej bazie danych pokazują, że wyższe wartości taux Euribor przesuwa prognozy w dół, co oznacza, że gdy stopy kredytowe/lendingu krótkoterminowe są wyższe w innych miejscach, klienti mniej skłonni są zdecydować się na ofertę lokaty tego konkretnego banku w porównaniu do innych okresów kampanii.
Pod macierzystymi zmiennymi, wynik dowolnej wcześniejszej kontakty marketingowej z tym samym klientem (poutcome) jest bardzo informatywny — ktoś, kto powiedział „tak” na poprzednią kampanię, jest znacznie bardziej prawdopodobny, aby to zrobić ponownie. Liczba kontaktów podjętych w bieżącym i wcześniejszym okresach kampanii, wiek klienta (z relacją nie-linearną, ponieważ osoby bardzo młode i emerytowane zachowują się inaczej niż pracujące dorosłe), oraz poziom edukacji zamykają top prognozatorów.
Zarzadzanie zadaniem jako rangowaniem, a nie klasyczne klasyfikacją
Ponieważ prawdziwa zestawienie cech produkcji obejmuje tylko informacje wygenerowane przed rozmową, praktyczna wersja tego zadania jest bliższa problemowi rangowania niż klasycznej klasyfikacji: na podstawie jedynie informacji dostępnych przed rozmową, produkuje się ocenę prawdopodobieństwa dla każdego klienta z listy rozmów, a następnie kontaktuje się klientów w odwrotnej kolejności względem prognozowanego poziomu prawdopodobieństwa. Ta zmiana perspektywy ma znaczenie również przy wyborze modelu: model, który jest tylko 'prawidłowo' dokładny w klasycznej klasyfikacji binarnej tak/nie, może nadal być bardzo użyteczny, jeśli jest dostatecznie dobrze kalibrowany do sensownego rangowania klientów, ponieważ centrum obsługi klienta z ograniczoną pojemnością najbardziej potrzebuje wiedzieć, kto powinien zostać priorytetowo obsłużony, a nie dokładne prawdopodobne oceny dla każdego imienia na liście.
Dlaczego prosta dokładność jest nieprawidłowym kryterium tutaj
Tylko około 12% klientów akceptuje deputat terminowy; reszta 88% odmawia. Model, który przewiduje 'nie' dla każdego klienta, byłby już w przybliżeniu 88% dokładny, ale całkowicie bezużyteczny dla celu banku związanego z znalezieniem mniejszości, która powie 'tak'. Jest to problem nierównomiernych klas, który pojawia się regularnie w modelowaniu reakcji na marketing, detekcji fałszywości i przewidywaniu odchodu klientów. Dlatego praktycy korzystają z miar, które są znacznie mniej tolerujące dla ślepej lojalności względem większości: ROC-AUC, który pomaga ocenić, jak dobrze model ranguje przypadki pozytywne nad negatywnymi na każdym możliwym próg decyzyjny; precyzję i czułość, które oddzielnie odnoszą się do liczby poprawnych przewidzianych 'tak' klientów w porównaniu do liczby rzeczywistych 'tak' klientów znalezionych; średnia harmoniczna F1-score; oraz precyzję i czułość ROC-AUC, które są zazwyczaj uważane za bardziej informacyjne niż ROC-AUC, szczególnie gdy pozytywne przypadki są rzadkie, ponieważ nie są podniesione przez wielkość łatwych fałszywych negatywnych.
Zasady mające zastosowanie poza jednym zestawem danych
Przyciąganie pułapki trwania jest przykładem użytecznym dokładnie dlatego, że łatwo go pominąć i łatwo go wyjaśnić, gdy zostanie znaleziony. Nauczona jest ona ogólną praktykę polegającą na tym, aby dla każdego kandydatów na cechę pytać dokładnie w momencie w rzeczywistym procesie, kiedy ta wartość staje się dostępna, i porównywać ten moment z chwilą, w której rzeczywiście trzeba wykonać prognozę. Cechy generowane jako efekt uboczny wyniku samego — długość połączenia, czas rozstrzygnięcia biletu wsparcia, status końcowy transakcji — są powszechne przestępcy poza branżą bankową, w tym modelach prognoz powrotu pacjentów do szpitala i modelach konwersji e-commerce. Zbieranie ich przed wdrożeniem to, co rozdziela model, który wykazuje błyskawiczną efektywność w notebooku, od tego, który rzeczywiście pomaga zarządcy call-centra decydować, kogo dzisiaj należy zatelefonować.
Często zadawane pytania
Czym jest przeboczenie danych w uczeniu maszynowym?
Przeboczenie danych występuje, gdy model jest nauczany za pomocą informacji, które nie byłyby dostępne w momencie, kiedy potrzeba dokonania rzeczywistej przewidywania. Często te informacje są generowane podczas lub po zdarzeniu, którego przewidowuje się. To sprawia, że metryki oceny offline wyglądają niezwykle dobrze, ale uczony model jest bezużyteczny lub nawet szkodliwy w produkcji.
Dlaczego nie można tylko zachować cechy dotyczące trwania i przyjąć przeboczenie, ponieważ poprawia to dokładność?
Bo cel modelu polega na decyzji, czy dzwonić do klienta przed tym, jak nastąpi wywołanie. Cecha istniejąca tylko po zakończeniu rozmowy nie może być wprowadzona w model podczas podejmowania decyzji, więc uczenie się na niej prowadzi do modelu, który nie można rozdzielić tak, jak było zamierzone, niezależnie od tego, jak dobrze wyglądają jego metryki oceny offline.
Jakie cechy pozostają najbardziej przewidywane po usunięciu trwania?
Indeksy makroekonomiczne takie jak stawka Euribor trzy miesięczna, stopa bezrobocia narodowego i stopa zmiany zatrudnienia rankują na szczycie, a następnie idą do przodu wynik dotychczasowych kontaktów marketingowych z klientem, liczba kontaktów dokonanych, wiek i poziom edukacji klienta.
Dlaczego dokładność jest fałszywym miarą dla tego typu problemu?
Bo tylko około 12% klientów subskrybuje, model, który zawsze przewiduje „nie”, uzyskałby dokładność około 88%, podczas gdy złapaliby zero rzeczywistych subskrybentów. Zamiast tego używa się miar takich jak ROC-AUC, AUC przeciwności prawdopodobieństwa i F1-score, które odpowiednio uwzględniają rzadkość klasy pozytywnej.
Jak można wykryć przeboczenie podobne do tego przed tym, jak spowoduje problemy?
Sprawdzając cechę po celu, czy wartość byłaby naprawdę znana w momencie potrzeby przewidywania w produkcji, oraz obserwując dowolną pojedynczą cechę, która przewiduje docelowy zmiennik niezwykle dobrze w porównaniu do tego, jak trudnym jest zazwyczaj rozumiane podstawowe zadanie biznesowe.
▶ Wypróbuj na żywo
Wszystko powyżej działa bezpośrednio w Twojej przeglądarce — otwórz The Call-Duration Trap: How Data Leakage Skews Bank Marketing Prediction Models i zmieniaj parametry podczas działania. Nic nie jest instalowane ani przesyłane na serwer, cały model działa w jednej karcie.