AccueilIA et Machine LearningClassificateur de modération de contenu — Score de toxicité en direct

🛡️ Classificateur de modération de contenu — Score de toxicité en direct

Observez un classificateur de toxicité de texte noter en direct un flux de publications sociales synthétiques mot par mot, en mettant en évidence exactement quels mots ont motivé chaque décision et seuil de modération.

IA et Machine Learning3DIntermédiaire60 FPS
ai-social-media-content-moderation ↗ Ouvrir en autonome

À propos du classificateur de modération de contenu

Les vrais pipelines de confiance et de sécurité notent chaque contenu généré par les utilisateurs face à un classificateur de texte avant qu'il n'atteigne une décision automatisée d'approbation/signalement/suppression, généralement un réseau de neurones entraîné sur des millions d'exemples étiquetés. Cette simulation construit une version petite mais totalement authentique de ce même pipeline de score : un flux synthétique de publications sociales est généré à partir de modèles couvrant des tons calmes, mixtes et hostiles, chaque publication est tokenisée en mots minuscules, chaque token est recherché dans un vocabulaire fixe de poids de toxicité appris, et la somme pondérée (mise à l'échelle par un curseur de sensibilité) passe par une sigmoïde logistique pour produire un score de toxicité entre 0 et 1 — exactement les mêmes mathématiques de somme pondérée plus sigmoïde qui se trouvent dans la couche de sortie des vrais classificateurs de texte linéaires et neuronaux.

Le panneau du haut affiche l'attribution au niveau des tokens : chaque mot de la publication actuelle est mis en évidence en rouge ou en vert proportionnellement à la mesure dans laquelle il a poussé le score vers la suppression ou l'approbation, si bien que vous pouvez voir précisément à quels mots le modèle réagit plutôt que de faire confiance à un nombre opaque. Le panneau du bas diffuse le score de toxicité de chaque publication notée au fil du temps sous forme de diagramme en barres par rapport à deux lignes de seuil ajustables en direct — faites glisser les seuils de signalement et de suppression pour voir le compromis réel entre sous-modération et sur-modération se jouer en temps réel, et changez le mix de scénarios entre Calme, Mixte et Hostile pour modifier la fréquence à laquelle un langage toxique apparaît réellement dans le flux.

Questions fréquentes

Comment ce classificateur note-t-il réellement une publication ?

Chaque publication synthétique entrante est tokenisée en la découpant sur les espaces et la ponctuation en tokens de mots en minuscules. Chaque token est recherché dans un vocabulaire fixe de poids de toxicité appris — des mots hostiles comme « idiot » ou « menacer » portent un poids positif, des mots bienveillants comme « merci » ou « gentil » portent un poids négatif, et les tokens inconnus contribuent zéro, exactement comme le ferait un vrai modèle de sac de mots. Les poids (mis à l'échelle par le curseur de sensibilité) sont additionnés, un biais fixe est ajouté, et le total passe par une sigmoïde logistique pour produire un score de toxicité entre 0 et 1. Il s'agit d'un véritable modèle de score linéaire/logistique, pas d'une animation décorative.

Qu'est-ce que l'attribution de tokens et pourquoi le panneau du haut met-il en évidence des mots individuels ?

L'attribution de tokens consiste à montrer combien chaque token individuel a contribué au score final, plutôt que de simplement présenter le score comme une boîte noire. Cette simulation calcule la contribution de chaque token comme son poids de vocabulaire multiplié par le réglage de sensibilité, puis colore la puce de ce token en rouge (poussant vers toxique) ou en vert (poussant vers approuvé) avec une intensité proportionnelle à la taille de sa contribution. Cela reflète la façon dont les vraies techniques d'explicabilité pour les classificateurs de texte, comme les attributions de style LIME ou SHAP ou la simple inspection des coefficients d'un modèle linéaire, permettent à un modérateur humain de voir quels mots spécifiques ont motivé une décision automatisée au lieu de simplement faire confiance à un unique nombre opaque.

Que contrôlent les seuils de signalement et de suppression ?

Le score de toxicité est un nombre continu entre 0 et 1, mais les systèmes de modération ont besoin d'actions discrètes. Cette simulation compare le score à deux seuils ajustables en direct : toute publication notée en dessous du seuil de signalement est approuvée automatiquement, tout ce qui est au niveau ou au-dessus du seuil de signalement mais en dessous du seuil de suppression est signalé pour examen humain, et tout ce qui est au niveau ou au-dessus du seuil de suppression est retiré automatiquement. Faire glisser l'un ou l'autre curseur reclassifie immédiatement les futures publications du flux et déplace les lignes de seuil sur le graphique en direct, vous permettant de voir le véritable compromis entre sous-modération (seuils trop élevés) et sur-modération (seuils trop bas).

Pourquoi utiliser une sigmoïde logistique plutôt que la simple somme pondérée brute ?

Une somme pondérée brute de poids de tokens n'est pas bornée — une publication longue et fortement chargée pourrait donner un nombre positif ou négatif très grand. La fonction sigmoïde logistique, score = 1 / (1 + e^-x), compresse toute entrée à valeur réelle dans une plage bornée de 0 à 1 qui se comporte comme une probabilité, si bien que les scores restent comparables entre des publications de longueurs et de gravités très différentes. C'est exactement la dernière couche utilisée dans les vrais classificateurs de texte par régression logistique et dans la couche de sortie de nombreux modèles neuronaux de détection de toxicité, convertissant un score interne de « log-odds » en un nombre de type probabilité interprétable sur lequel un seuil peut agir.

À quel point est-ce réaliste comparé aux systèmes de modération en production comme Perspective API ?

Perspective API de Google Jigsaw, et la plupart des classificateurs de toxicité en production, sont entraînés sur des millions de vrais commentaires étiquetés par des humains en utilisant des réseaux de neurones profonds (souvent basés sur des transformeurs) qui capturent le contexte, la négation et le sarcasme bien au-delà d'une somme de sac de mots. Cette simulation utilise un petit vocabulaire assigné à la main de quelques dizaines de tokens et une seule couche linéaire-plus-sigmoïde plutôt qu'un réseau entraîné, elle doit donc être lue comme une démonstration transparente et inspectable du mécanisme mathématique de score auquel ces systèmes se réduisent finalement, et non comme un outil de modération de qualité production.

Quelles sont les limites d'une approche par vocabulaire pondéré pour la détection de toxicité ?

Comme le score ne fait que sommer des poids fixes par token, cette approche ne peut pas détecter la négation (« pas stupide » note dans la même direction que « stupide »), le sarcasme, le harcèlement codé qui évite les mots listés, ou le contexte qui change le sens d'une phrase entière. Elle peut aussi se tromper sur un langage réapproprié ou cité et sur tout token en dehors de son vocabulaire fixe, qui contribue simplement zéro quelle que soit la façon dont il est réellement utilisé. Les vrais systèmes atténuent cela avec des modèles de langage contextuels, mais chaque classificateur neuronal produit encore finalement un score unique qui est seuillé exactement comme cette simulation le démontre.

⚙ Sous le capot

Chaque publication synthétique est tokenisée, le poids de toxicité appris de chaque token est mis à l'échelle par la sensibilité et sommé avec un biais fixe, et une sigmoïde logistique convertit cette somme en un score de toxicité entre 0 et 1 — qui est ensuite seuillé en direct en approuvé / signalé / supprimé pendant que le panneau du haut affiche l'attribution par token.

Text ClassificationToken AttributionLogistic ScoringContent ModerationLive Stream

3D · Moteur de rendu Three.js / WebGL · cible 60 FPS · s'exécute entièrement côté client, sans installation

Qu'avez-vous trouvé ?

Ajouter les étapes de reproduction (facultatif)