⚖️ Prédicteur d'issue de dossier juridique — Random Forest en direct
Observez une véritable forêt aléatoire d'arbres de décision bootstrappés indépendamment voter sur des caractéristiques de dossier simulées (force du précédent, score de preuve, juridiction), avec des votes par arbre en direct convergeant vers une probabilité d'issue d'ensemble.
À propos de cette simulation
Ce simulateur construit un véritable classifieur random forest dans le navigateur et vous permet d'observer sa réflexion. Un ensemble d'entraînement synthétique de dossiers juridiques est généré à partir de caractéristiques simplifiées et explicitement codées — force du précédent, force de la preuve, juridiction et complexité du dossier — combinées avec un bruit aléatoire en une véritable probabilité de victoire sous-jacente. Des dizaines d'arbres de décision sont ensuite chacun entraînés sur leur propre sous-échantillon bootstrap de ces données, en divisant les nœuds par une véritable minimisation de l'impureté de Gini sur un sous-ensemble aléatoirement restreint de caractéristiques, jusqu'à une profondeur maximale. Pour tout dossier que vous configurez avec les curseurs, chaque arbre émet un vote indépendant en parcourant sa propre structure apprise, et la probabilité d'ensemble de la forêt est simplement la fraction d'arbres votant pour le demandeur.
🔬 Ce que ça montre
Une grille en direct de cubes, un par arbre de la forêt, coloré en violet ou en ambre selon le vote actuel de chaque arbre et éclairci selon la confiance au niveau de la feuille de cet arbre. En dessous, une barre de jauge montre la probabilité d'ensemble résultante et un sparkline trace comment cette probabilité évolue à mesure que vous ajustez les caractéristiques du dossier en temps réel.
🎮 Comment l'utiliser
Faites glisser les curseurs de précédent, de preuve et de complexité et choisissez une juridiction pour définir le dossier examiné — chaque arbre revote instantanément. Utilisez les curseurs d'hyperparamètres pour changer le nombre d'arbres, la profondeur maximale de l'arbre, et combien de caractéristiques aléatoires chaque division considère, puis appuyez sur Réentraîner pour reconstruire la forêt, ou Régénérer les données d'entraînement pour rééchantillonner un tout nouvel ensemble de dossiers synthétiques. Le bouton de balayage automatique anime en continu les caractéristiques du dossier afin que vous puissiez observer la convergence en direct.
💡 Le saviez-vous ?
Le « random » dans random forest vient de deux sources indépendantes de hasard : le rééchantillonnage bootstrap des lignes d'entraînement (bagging), et la restriction de chaque division à un sous-ensemble aléatoire de caractéristiques plutôt qu'à toutes. Cette seconde astuce, introduite par Leo Breiman en 2001, décorrèle les arbres les uns des autres — sans elle, la plupart des arbres d'une forêt redécouvriraient la même division dominante et l'ensemble surpasserait à peine un seul arbre profond.
Questions fréquentes
Qu'est-ce qu'une random forest, et en quoi diffère-t-elle d'un seul arbre de décision ?
Un seul arbre de décision divise récursivement les données d'entraînement en utilisant la caractéristique et le seuil qui réduisent le plus l'impureté de classe (mesurée ici par l'impureté de Gini) à chaque nœud, jusqu'à une profondeur maximale. Une random forest entraîne indépendamment de nombreux arbres de ce type, chacun sur son propre sous-échantillon bootstrap de l'ensemble d'entraînement (échantillonnage avec remise) et, à chaque division, en ne considérant qu'un sous-ensemble aléatoire des caractéristiques disponibles plutôt que toutes. Moyenner les votes de nombreux arbres décorrélés réduit la variance du surapprentissage de chaque arbre pris isolément, ce qui explique pourquoi les forêts généralisent généralement mieux qu'un seul arbre profond entraîné sur toutes les données.
Que signifie « l'exactitude out-of-bag » et pourquoi est-elle fiable ?
Comme chaque arbre est entraîné sur un sous-échantillon bootstrap, environ un tiers des cas d'entraînement sont laissés de côté par l'échantillon d'un arbre donné — ses cas « out-of-bag » (OOB). Pour chaque cas d'entraînement, cette simulation collecte le vote majoritaire uniquement des arbres qui N'ont PAS vu ce cas pendant l'entraînement, puis compare cette prédiction out-of-bag à la véritable étiquette. Comme aucun arbre ne vote jamais sur un cas sur lequel il a été entraîné, l'exactitude OOB se comporte comme un test de validation honnête intégré — semblable en esprit à la validation croisée mais calculée gratuitement à partir de la procédure de bagging elle-même.
Pourquoi les arbres individuels sont-ils en désaccord sur le même dossier ?
Chaque arbre ne voit jamais qu'un sous-échantillon bootstrap des données d'entraînement et un ensemble aléatoirement restreint de caractéristiques candidates à chaque division, si bien que différents arbres finissent par apprendre des vues partielles différentes et imparfaites du même motif sous-jacent. Sur les dossiers limites — où précédent, preuve et complexité s'équilibrent à peu près — les arbres peuvent légitimement se retrouver de part et d'autre de la frontière de décision qu'ils ont chacun découverte séparément. Cette dispersion d'opinions est exactement ce que quantifie la statistique de « taux d'accord des arbres » : un accord élevé signifie que la forêt est confiante, un faible accord signale un dossier réellement contesté.
Cette simulation prédit-elle de véritables issues juridiques ?
Non. Les dossiers d'entraînement sont synthétiques : chacun est généré à partir d'une règle simplifiée et explicitement codée qui combine force simulée du précédent, force de la preuve, juridiction et complexité du dossier en une probabilité de victoire, plus un bruit aléatoire, et l'étiquette est ensuite tirée de cette probabilité. Le but de la simulation est de rendre visibles et manipulables les mécanismes de la classification random forest — échantillonnage bootstrap, division basée sur Gini, vote par arbre, validation out-of-bag — pas de modéliser de véritables tribunaux ou une véritable jurisprudence.
Que se passe-t-il si j'augmente la profondeur maximale de l'arbre ou réduis le nombre d'arbres ?
Des arbres plus profonds peuvent découper l'espace des caractéristiques en régions plus petites et plus spécifiques, ce qui améliore généralement l'ajustement sur l'échantillon bootstrap exact que chaque arbre a vu mais augmente aussi le risque qu'un arbre donné surapprenne le bruit ; une random forest tolère cela car elle moyenne de nombreux arbres de ce type. Moins d'arbres rendent l'ensemble plus rapide à réentraîner mais plus bruité et moins stable — la probabilité d'ensemble et l'estimation d'exactitude out-of-bag fluctueront davantage entre réentraînements car il y a moins de votes indépendants à moyenner.
Un jeu de données synthétique de dossiers juridiques est généré à partir d'une règle simplifiée sur la force du précédent, la force de la preuve, la juridiction et la complexité, plus du bruit. Des dizaines d'arbres de décision sont chacun entraînés sur un sous-échantillon bootstrap indépendant à l'aide d'une véritable division par impureté de Gini sur un sous-ensemble aléatoire de caractéristiques, puis votent indépendamment sur le dossier que vous configurez — avec une exactitude out-of-bag calculée honnêtement à partir des arbres qui n'ont jamais vu chaque cas d'entraînement.
3D · Three.js / WebGL renderer · 60 FPS target · runs fully client-side, no install