Strona głównaAI i MLWykrywacz oszustw w kliknięciach reklam — prawo Benforda na żywo

🖱️ Wykrywacz oszustw w kliknięciach reklam — prawo Benforda na żywo

Obserwuj, jak prawdziwy test statystyczny prawa Benforda porównuje na żywo częstości pierwszej cyfry symulowanych liczb kliknięć reklam z prawdziwym oczekiwanym rozkładem logarytmicznym, aby wykrywać oszukańcze źródła ruchu.

AI i ML3DUmiarkowany60 FPS
ai-ad-click-fraud-detection ↗ Otwórz osobno

O wykrywaczu oszustw w kliknięciach reklam opartym na prawie Benforda

Ta symulacja uruchamia prawdziwy proces analizy cyfr według prawa Benforda nad kilkoma symulowanymi źródłami ruchu reklamowego. Każde źródło generuje strumień wartości liczby kliknięć w wielu kampaniach lub okresach raportowania; wiodąca (pierwsza) cyfra każdej wartości jest wyodrębniana i zestawiana w obserwowany histogram częstości, który jest następnie porównywany z rzeczywistym oczekiwanym rozkładem Benforda P(d) = log₁₀(1 + 1/d) za pomocą działającej na żywo statystyki zgodności chi-kwadrat. Nic w tej statystyce dopasowania nie jest zakodowane na sztywno — jest ona przeliczana z rzeczywistego wygenerowanego zbioru danych za każdym razem, gdy zmienisz próbę lub przełączysz źródło.

🔬 Co pokazuje

Dziewięć 3D słupków dla każdego źródła ruchu, po jednym dla każdej możliwej wiodącej cyfry 1-9: pełny słupek pokazuje obserwowaną częstość źródła, przezroczysty słupek szkieletowy za nim pokazuje oczekiwaną częstość Benforda. Źródła „prawdziwe” są generowane przez log-jednostajny proces multiplikatywny obejmujący kilka rzędów wielkości — klasyczny warunek, w którym prawdziwe liczby kliknięć podlegają prawu Benforda. Źródła „oszustwo” zamiast tego losują liczby jednostajnie z wąskiego pasma liczbowego, co w sposób dowiedziony nie odtwarza logarytmicznego rozkładu wiodącej cyfry.

🎮 Jak korzystać

Przełączaj dowolne źródło między Prawdziwe a Oszustwo za pomocą przycisków w lewym panelu, dostosuj rozmiar próby (okresy na źródło) za pomocą suwaka i naciśnij Resampluj, aby wylosować nową partię danych o kliknięciach. Przeciągnij, aby obrócić scenę 3D, przewiń, aby przybliżyć, i kliknij dowolny słupek lub kartę źródła, aby zbadać jego dokładną statystykę χ², przybliżoną wartość p i średnie odchylenie bezwzględne (MAD) w panelu szczegółów. Lista rankingowa sortuje się na żywo według wskaźnika prawdopodobieństwa oszustwa (χ²) w miarę zmiany danych.

💡 Czy wiesz, że?

Prawo Benforda zostało po raz pierwszy zauważone przez astronoma Simona Newcomba w 1881 roku, który zauważył, że pierwsze strony tablic logarytmicznych były znacznie bardziej zużyte niż tylne strony — co oznacza, że ludzie szukali liczb zaczynających się od 1 znacznie częściej niż liczb zaczynających się od 9. Jest to obecnie standardowe narzędzie rachunkowości śledczej i wykrywania oszustw, wykorzystywane do przesiewania deklaracji podatkowych, liczby głosów wyborczych, danych naukowych oraz — jak pokazano tutaj — raportów o cyfrowym ruchu reklamowym pod kątem oznak fabrykacji.

Najczęściej zadawane pytania

Czym jest prawo Benforda i dlaczego dotyczy danych o kliknięciach reklam?

Prawo Benforda mówi, że dla wielu naturalnie występujących, wieloskalowych zbiorów danych liczbowych pierwsza (wiodąca) cyfra d nie jest rozłożona jednostajnie w zakresie 1-9, lecz zamiast tego podąża wzorem P(d) = log₁₀(1 + 1/d) — więc około 30,1% wartości zaczyna się od 1, 17,6% od 2, aż do zaledwie 4,6% zaczynających się od 9. Pojawia się ono wszędzie tam, gdzie leżąca u podstaw wielkość obejmuje kilka rzędów wielkości, a jej logarytm jest w przybliżeniu jednostajnie rozłożony, co jest dokładnie tym, co dzieje się z organicznymi liczbami kliknięć reklam zagregowanymi w kampaniach o skrajnie różnych rozmiarach, budżetach i zasięgu. Sfabrykowane dane — generowane przez wybieranie liczb w wąskim zakresie, by wyglądały wiarygodnie — nie mają tej wieloskalowej struktury, więc nie odtwarzają właściwości log-jednostajnej, a ich wiodące cyfry odbiegają od oczekiwanej krzywej Benforda.

Jak działa tu test zgodności chi-kwadrat?

Dla każdego źródła ruchu zliczamy, ile z jego N wartości liczby kliknięć ma każdą wiodącą cyfrę od 1 do 9, uzyskując obserwowane liczby O(d). Obliczamy oczekiwaną liczbę zgodnie z prawem Benforda jako E(d) = N × log₁₀(1 + 1/d). Statystyka chi-kwadrat wynosi χ² = Σ (O(d) − E(d))² / E(d), obliczana na żywo z rzeczywistych symulowanych danych przy każdym odświeżeniu — nic nie jest zakodowane na sztywno. Przy 9 kategoriach cyfr mamy 8 stopni swobody, a standardowa wartość krytyczna dla poziomu istotności 5% wynosi 15,507; źródła, których statystyka chi-kwadrat przekracza ten próg, są oznaczane jako statystycznie niezgodne z prawdziwym, naturalnie skalowanym ruchem.

Co generuje w symulacji ruch „prawdziwy” w porównaniu z „oszukańczym”?

Prawdziwe źródła losują liczby kliknięć z log-jednostajnego procesu multiplikatywnego: skala bazowa to 10 podniesione do jednostajnie losowego wykładnika między 1 a około 5,2 (więc wielkości sięgają od dziesiątek do setek tysięcy), pomnożone przez szum lognormalny reprezentujący dzienną zmienność kampanii. Ponieważ wykładnik jest jednostajny, wynikowe wiodące cyfry ściśle podążają za prawem Benforda, odzwierciedlając zachowanie prawdziwego zagregowanego ruchu internetowego. Oszukańcze źródła zamiast tego losują liczby jednostajnie z wąskiego pasma liczbowego, na przykład od 500 do 900 kliknięć — wzorzec typowy dla farm kliknięć lub botów próbujących wyglądać na stały, wiarygodny wolumen, co matematycznie nie może odtworzyć logarytmicznego rozkładu wiodącej cyfry.

Co wnosi średnie odchylenie bezwzględne (MAD) poza chi-kwadrat?

Chi-kwadrat jest wrażliwy na liczebność próby N — przy wystarczającej ilości danych nawet drobne, praktycznie nieistotne odchylenia stają się statystycznie istotne. Średnie odchylenie bezwzględne, MAD = (1/9) × Σ |obserwowany ułamek(d) − P(d)|, mierzy przeciętną wielkość samego odchylenia, niezależnie od N. Praktycy analizy cyfr (zgodnie z konwencjami rachunkowości śledczej Nigriniego) traktują MAD poniżej około 0,006 jako bliską zgodność, 0,006–0,012 jako dopuszczalną, 0,012–0,015 jako graniczną, a powyżej 0,015 jako niezgodność. Podawanie obu statystyk razem — chi-kwadrat dla istotności statystycznej i MAD dla wielkości efektu — daje pełniejszy obraz niż każda z osobna.

Czy sama analiza prawa Benforda może udowodnić, że źródło ruchu jest oszukańcze?

Nie — prawo Benforda to heurystyka przesiewowa, a nie dowód. Niektóre prawdziwe zbiory danych nie są z nim zgodne, ponieważ z uzasadnionych powodów są ograniczone do wąskiego zakresu (na przykład mała kampania o stałym budżecie, która zawsze kupuje zbliżoną liczbę kliknięć), a niektóre sfabrykowane dane można celowo skonstruować tak, by naśladowały rozkład logarytmiczny. W rzeczywistym wykrywaniu oszustw reklamowych istotny wynik chi-kwadrat dla liczby kliknięć jest jednym z wielu sygnałów — obok wzorców czasowych kliknięć, odcisków palca urządzeń, reputacji IP i anomalii współczynnika konwersji — które analitycy wykorzystują do ustalania priorytetów, które źródła ruchu zasługują na dogłębniejsze zbadanie.

Dlaczego słupki obserwowanej częstości cyfr wciąż się poruszają, nawet bez zmiany ustawień?

Obserwowane słupki animują się płynnie w kierunku nowej docelowej wysokości za każdym razem, gdy zmieniają się leżące u podstaw dane — na przykład gdy przełączasz źródło między prawdziwym a oszukańczym, zmieniasz rozmiar próby lub klikasz Resampluj. Jest to czysto wizualny efekt wygładzania dla czytelności; statystyka chi-kwadrat i wartość p pokazywane w panelu bocznym są zawsze obliczane bezpośrednio z ostatecznych, ustalonych danych, a nie z pośredniej animowanej klatki.

⚙ Pod maską

Dziewięciocyfrowe histogramy wiodącej cyfry są zestawiane na żywo dla każdego źródła i porównywane z P(d) = log₁₀(1 + 1/d) za pomocą prawdziwej statystyki zgodności χ² i średniego odchylenia bezwzględnego, przeliczanych przy każdym resamplingu.

Prawo BenfordaTest chi-kwadratWykrywanie oszustwStatystykaAnaliza cyfr

3D · Renderer Three.js / WebGL · cel 60 FPS · działa w całości po stronie klienta, bez instalacji

Co znalazłeś/aś?

Dodaj kroki odtworzenia (opcjonalnie)