HomeIA e Machine LearningClassificatore di Frodi del Settore Pubblico — Precisione, Richiamo e la Matrice di Confusione

🏛️ Classificatore di Frodi del Settore Pubblico — Precisione, Richiamo e la Matrice di Confusione

Un classificatore assegna un punteggio alle richieste di sussidio in base al rischio di frode — osserva la matrice di confusione, la precisione e il richiamo cambiare dal vivo mentre trascini la soglia decisionale su una vera popolazione con punteggio.

IA e Machine Learning3DModerata60 FPS
ai-government-data-analytics ↗ Apri standalone

Informazioni sul Classificatore di Frodi del Settore Pubblico

Le agenzie governative che erogano sussidi, sovvenzioni o rimborsi usano sempre più il punteggio di rischio statistico per decidere quali richieste meritano un esame più attento. Questa simulazione genera una popolazione sintetica di alcune centinaia di richieste con un tasso di frode sottostante dell'8% — deliberatamente basso, perché la frode reale sui sussidi è un evento genuinamente raro rispetto al volume di richieste legittime — e addestra un vero classificatore di regressione logistica su due caratteristiche visibili (z-score dell'importo della richiesta e punteggio di anomalia del pattern di deposito) usando la discesa del gradiente batch sulla perdita di cross-entropia, esattamente come verrebbe addestrato un modello in produzione, solo a una scala che puoi osservare convergere epoca dopo epoca.

Una volta addestrato, ogni richiesta porta una probabilità di frode dal vivo, resa come mappa di calore di probabilità dietro il grafico a dispersione. Trascinare il cursore di soglia cambia quali richieste contano come "segnalate", e la matrice di confusione, precisione, richiamo, punteggio F1 e tasso di falsi positivi si aggiornano tutti immediatamente rispetto alle vere etichette (normalmente nascoste) della popolazione. Un controllo di capacità di revisione aggiunge il vincolo sotto cui opera ogni vero team antifrode: gli investigatori possono esaminare solo un certo numero di richieste per periodo, quindi la soglia "statisticamente corretta" e la soglia "operativamente sostenibile" sono spesso due numeri diversi.

Domande frequenti

Perché la precisione è così difficile da ottenere qui, anche con un modello ben separato, quando solo l'8% delle richieste è fraudolento?

Questo è l'effetto del tasso di base (prior). Supponiamo che 500 richieste includano 40 fraudolente (un tasso dell'8%) e che il modello raggiunga un forte richiamo dell'85% con un modesto tasso di falsi positivi del 6% sul gruppo legittimo molto più grande. Segnala correttamente 34 dei 40 casi di frode (veri positivi) — ma il tasso di falsi positivi si applica a tutte le 460 richieste legittime, producendo circa 28 falsi positivi. Precisione = 34/(34+28) ≈ 55%, anche se il modello sottostante è genuinamente buono. Quando la condizione che stai cercando è rara, la pura dimensione della classe negativa fa sì che anche un basso tasso di falsi positivi generi un numero assoluto di falsi allarmi che rivaleggia con i veri positivi. Questa è la stessa aritmetica dietro il classico paradosso del "test per malattie rare" in medicina.

Cosa significa operativamente ciascuna cella della matrice di confusione per un team di revisione frodi governativo?

Vero positivo: una richiesta genuinamente fraudolenta viene segnalata, viene indagata, e il riscontro viene confermato — il sistema ha funzionato. Falso positivo: un richiedente legittimo viene segnalato, consuma il tempo di un investigatore su un caso che risulta pulito, e può affrontare una revisione stressante, un ritardo nel pagamento, o un processo di ricorso — questo è l'onere dell'indagine e, su larga scala, un costo di equità e fiducia. Falso negativo: una richiesta fraudolenta ottiene un punteggio sotto la soglia e non riceve alcun controllo — viene pagato denaro che non avrebbe dovuto esserlo, e nessuno viene mai avvisato di ricontrollare a meno che il caso non riemerga in qualche altro modo. Vero negativo: una richiesta legittima viene correttamente lasciata in pace — l'esito invisibile, senza eventi, e più comune, poiché la maggior parte delle richieste è legittima.

Perché la capacità di revisione conta come vincolo reale oltre alla scelta della soglia statistica?

Una soglia scelta puramente per bilanciare precisione e richiamo statisticamente può comunque segnalare molte più richieste di quante gli investigatori possano effettivamente esaminare in un periodo — trasformando un problema di punteggio in un problema di triage. Se la capacità è di 50 revisioni per periodo ma la soglia segnala 140 richieste, o la coda si accumula indefinitamente, o i casi restano non esaminati oltre le scadenze utili, oppure il personale prende decisioni affrettate e di qualità inferiore. In pratica, le agenzie spesso invertono la logica: invece di scegliere prima un limite di probabilità, classificano tutte le richieste per punteggio di frode e prendono le prime N fino alla capacità, il che è matematicamente equivalente a scegliere qualsiasi soglia che produca esattamente N segnalazioni in quel periodo. La capacità, non solo le statistiche, finisce spesso per impostare la soglia operativa nel mondo reale.

In cosa differisce questo dal rilevamento in tempo reale delle frodi con carta di credito al consumo?

Il rilevamento di frodi con carta assegna un punteggio a una transazione in millisecondi e può bloccarla o approvarla automaticamente all'istante, con un rimedio rapido e a basso rischio se sbaglia (un rifiuto della carta, un messaggio di follow-up). Il controllo delle frodi sui sussidi governativi alimenta invece una pipeline di revisione umana più lenta, è soggetto a diritti di giusto processo e ricorso, e un falso positivo può significare che il reddito di un richiedente vulnerabile viene sospeso o ritardato per settimane mentre un caso viene indagato — un costo dell'errore molto più alto sulle persone coinvolte. La frode sui sussidi è anche tipicamente più rara come quota delle richieste, le caratteristiche disponibili sono di solito amministrative anziché biometrico-comportamentali, e le conseguenze legali e reputazionali di una segnalazione errata sono molto più gravi per il settore pubblico che per una banca.

Perché il bias e l'equità contano specialmente per questo tipo di applicazione?

Caratteristiche come l'importo della richiesta e le anomalie del pattern di deposito possono correlarsi, indirettamente, con caratteristiche protette come la composizione del nucleo familiare, la disabilità, l'etnia, o la deprivazione legata al codice postale — anche quando quelle caratteristiche non vengono mai usate direttamente. Se i falsi positivi ricadono sproporzionatamente su gruppi già svantaggiati, uno strumento di screening automatizzato può aggravare sistematicamente il danno verso persone meno in grado di assorbire un'indagine ingiusta o un pagamento sospeso. Casi reali come lo scandalo dei sussidi per l'infanzia nei Paesi Bassi e lo schema Robodebt in Australia hanno mostrato come sistemi automatizzati di rilevamento frodi e debiti, distribuiti senza un adeguato audit sui sottogruppi, spiegabilità, o un genuino diritto di ricorso, abbiano causato danni ingiusti su larga scala. Ecco perché gli audit di precisione/richiamo a livello di sottogruppo, la revisione umana dei casi segnalati e chiari diritti di ricorso sono trattati come requisiti di primaria importanza in questo dominio, non extra opzionali.

Cosa fa effettivamente qui la regressione logistica, e perché addestrarla con la discesa del gradiente?

La regressione logistica combina le due caratteristiche di input con pesi appresi w₁, w₂ e un bias b in un unico punteggio z = w₁x₁ + w₂x₂ + b, poi schiaccia quel punteggio in una probabilità con la funzione sigmoide p = 1/(1+e⁻ᶻ). L'addestramento significa scegliere w₁, w₂, b per minimizzare la perdita di cross-entropia — la media di −[y·log(p) + (1−y)·log(1−p)] su ogni richiesta, dove y è la vera etichetta di frode. Poiché questa perdita è convessa nei pesi per la regressione logistica, la discesa del gradiente — calcolando ripetutamente il gradiente della perdita rispetto a ciascun peso e facendo un piccolo passo contro di esso — converge in modo affidabile allo stesso ottimo globale ogni volta che riaddestri, cosa che questa simulazione esegue realmente, epoca dopo epoca, osservando la perdita scendere.

Perché esiste un compromesso tra precisione e richiamo, e come lo controlla il cursore di soglia?

Il modello produce una probabilità di frode continua per ogni richiesta; il cursore di soglia decide il limite oltre il quale una richiesta conta come "segnalata". Abbassare la soglia segnala più richieste in totale, il che necessariamente cattura più dei veri casi di frode (richiamo più alto) ma coinvolge anche più richieste legittime che avevano semplicemente un punteggio moderatamente alto (precisione più bassa). Alzare la soglia fa l'opposto: segnalazioni meno numerose ma più sicure, quindi la precisione sale ma il richiamo scende man mano che i casi di frode marginali sfuggono sotto la barra. Poiché la distribuzione dei punteggi sottostante si sovrappone tra le classi, nessuna singola soglia massimizza entrambi simultaneamente — il cursore ti permette di tracciare dal vivo l'intera curva di compromesso, cella per cella, nella matrice di confusione.

⚙ Come funziona

Un classificatore assegna un punteggio alle richieste di sussidio in base al rischio di frode — osserva la precisione e il richiamo cambiare dal vivo mentre trascini la soglia decisionale.

Three.jsWebGLAIMachine Learning

3D · renderer Three.js / WebGL · target 60 FPS · funziona interamente lato client, senza installazione

Cosa hai trovato?

Aggiungi i passaggi per riprodurre il problema (opzionale)