AccueilIA et apprentissage automatiqueRésumeur de documents juridiques — TextRank en direct

📄 Résumeur de documents juridiques — TextRank en direct

Observez un véritable algorithme de classement par graphe TextRank noter et extraire les phrases les plus importantes d'un document juridique synthétique, en construisant en direct le graphe de similarité entre phrases avant de sélectionner un résumé.

IA et apprentissage automatique3DModéré60 FPS
ai-legal-document-summarization ↗ Ouvrir en autonome

À propos de cette simulation

Cette simulation exécute un véritable pipeline de résumé extractif TextRank sur un contrat juridique synthétique. Un ensemble de clauses réalistes — résiliation, confidentialité, indemnisation, responsabilité, paiement, droit applicable, force majeure, notifications, garanties, et propriété intellectuelle — est échantillonné en un nouveau document synthétique à chaque régénération. Chaque phrase est tokenisée, les mots vides sont retirés, et un véritable score de similarité basé sur le recouvrement est calculé entre chaque paire de phrases pour construire un graphe pondéré. Ce graphe est ensuite classé avec la même récurrence par itération de puissance amortie que celle utilisée par le PageRank original de Google, observée en direct pendant sa convergence.

🔬 Ce que ça montre

Un graphe de similarité entre phrases où la taille et la couleur des nœuds encodent le score TextRank en direct de chaque phrase, et l'épaisseur/opacité des arêtes encode le véritable poids de similarité entre deux phrases. En dessous, le document original est affiché en entier, avec les phrases actuellement classées dans la fraction de compression supérieure mises en évidence comme résumé extrait — replacées dans leur position d'origine, exactement comme le font les résumeurs extractifs en production.

🎮 Comment l'utiliser

Ajustez le curseur de taux de compression pour contrôler quelle fraction des phrases compose le résumé, et le curseur de facteur d'amortissement (d) pour contrôler à quel point les scores se propagent dans le graphe avant de se stabiliser. Utilisez Étape +1 pour avancer l'itération de puissance pas à pas, ou Exécuter jusqu'à convergence pour l'animer automatiquement. Réinitialiser les itérations relance le calcul des scores à partir d'une valeur uniforme 1/N sans toucher au document ; Régénérer le document tire un tout nouveau contrat synthétique et reconstruit le graphe depuis zéro.

💡 Le saviez-vous ?

La formule de similarité entre phrases de TextRank — mots partagés divisés par la somme des logarithmes de la longueur de chaque phrase — a été choisie par ses auteurs originaux spécifiquement pour que des paires de phrases très courtes n'obtiennent pas des scores de similarité gonflés simplement parce qu'elles partagent un mot ou deux. C'est un petit détail, mais il empêche le graphe résultant d'être dominé par des formules toutes faites.

Questions fréquentes

Qu'est-ce que TextRank et comment résume-t-il un document ?

TextRank est un algorithme de classement basé sur un graphe, adapté du PageRank de Google. Chaque phrase d'un document devient un nœud d'un graphe, et les arêtes sont pondérées selon la similarité entre deux phrases. Exécuter l'itération de puissance de PageRank sur ce graphe produit un score d'importance pour chaque phrase ; les phrases au score le plus élevé, prises dans leur ordre original, forment le résumé extrait.

Comment la similarité entre phrases est-elle réellement calculée ici ?

Chaque phrase est tokenisée en mots de contenu en minuscules, les mots vides courants étant retirés. La similarité entre deux phrases est le nombre de mots qu'elles partagent, normalisé par la somme des logarithmes du nombre de mots de chaque phrase — la mesure de recouvrement de l'article original de Mihalcea et Tarau sur TextRank. Cela produit un véritable graphe pondéré de similarité entre phrases, pas un graphe décoratif.

Que contrôle le curseur de facteur d'amortissement ?

Le facteur d'amortissement (d) est le même paramètre utilisé dans PageRank : à chaque itération, le score d'une phrase est un mélange d'une petite base constante, (1-d)/N, plus d fois les scores qu'elle hérite des phrases similaires. Un amortissement plus élevé signifie que les scores se propagent davantage dans le graphe de similarité avant de se stabiliser ; un amortissement plus faible converge plus vite mais repose davantage sur la base uniforme.

Que contrôle le taux de compression ?

Le taux de compression fixe quelle fraction des phrases du document est conservée dans le résumé extrait. Il réordonne les phrases selon leur score TextRank en direct, conserve la fraction supérieure, puis retrie ce sous-ensemble dans l'ordre original du document afin que le résumé reste cohérent à la lecture.

L'algorithme de classement est-il réel, ou juste un effet visuel ?

C'est une implémentation authentique. La simulation construit une véritable matrice d'adjacence pondérée à partir de vrais scores de similarité par recouvrement de texte et exécute la récurrence PageRank amortie par itération de puissance jusqu'à ce que les scores cessent de changer de plus d'un petit epsilon, exactement comme fonctionnent les résumeurs extractifs TextRank dans les bibliothèques NLP de production.

⚙ Sous le capot

Observez un véritable algorithme de classement par graphe TextRank noter et extraire les phrases les plus importantes d'un document juridique synthétique, en construisant en direct le graphe de similarité entre phrases avant de sélectionner un résumé.

Canvas 2DNLPGraph AlgorithmsTextRankPageRank

3D · Three.js / WebGL renderer · 60 FPS target · runs fully client-side, no install

Qu'avez-vous trouvé ?

Add reproduction steps (optional)