InicioIA y Aprendizaje AutomáticoClasificador de Cláusulas Contractuales

⚖️ Clasificador de Cláusulas Contractuales — Señalización de Riesgo con PLN en Vivo

Introduce cláusulas de un contrato sintético en un clasificador de PLN que señala en tiempo real el riesgo de indemnización, rescisión y responsabilidad, resaltando exactamente qué tokens motivaron cada señalización.

IA y Aprendizaje Automático3DAvanzado60 FPS
ai-legal-contract-analysis ↗ Abrir independiente

Acerca del Clasificador de Cláusulas Contractuales

Los equipos legales que revisan un contrato comercial extenso necesitan encontrar el puñado de cláusulas que realmente conllevan un riesgo desproporcionado —una indemnización sin límite, un derecho unilateral de rescisión por conveniencia, una renuncia de responsabilidad oculta entre cláusulas estándar— sin leer cada sección de definiciones y cláusula de notificación con el mismo grado de escrutinio. Las herramientas de revisión de contratos basadas en PLN automatizan esta primera pasada: leen cada cláusula, la puntúan por riesgo, y muestran las que superan un umbral para que un abogado humano las revise. Esta simulación construye una versión real y funcional de esa primera pasada, en lugar de una animación estilizada de una.

Bajo el capó hay una auténtica regresión logística de bolsa de palabras: un vocabulario fijo de aproximadamente 45 términos legales, cada uno con un coeficiente con signo asignado a mano y etiquetado con una categoría de indemnización, rescisión o responsabilidad, combinado con un término de sesgo y pasado por la función sigmoide para producir una probabilidad de riesgo entre 0 y 1 por cláusula. Como el modelo es lineal, la contribución de cada token a la puntuación es exacta y visible: el panel de texto resaltado colorea cada palabra según su coeficiente literal, colores cálidos para los términos que aumentan el riesgo como "indemnizar" o "sin límite" y colores fríos para los términos que lo reducen como "límite" o "subsanación". Recorre cláusula por cláusula un contrato sintético de 24 cláusulas, o déjalo reproducirse automáticamente, y observa cómo se construyen en vivo el gráfico de riesgo a nivel de documento y los recuentos de señalización por categoría.

Preguntas Frecuentes

¿Cómo decide realmente esta simulación que una cláusula es riesgosa?

Cada cláusula se tokeniza en palabras en minúscula, y cada token se busca en un vocabulario legal fijo de unos 45 términos, cada uno con un coeficiente con signo real: por ejemplo, "indemnizar" lleva +2.2, "sin límite" lleva +2.3, mientras que los términos que reducen el riesgo como "límite" o "subsanación" llevan coeficientes negativos como −1.2 y −0.6. La puntuación bruta de la cláusula es el término de sesgo más la suma de los coeficientes de cada token encontrado, y esa puntuación bruta se pasa por la función sigmoide logística 1/(1+e⁻ᶻ) para producir una puntuación de riesgo similar a una probabilidad entre 0 y 1. Esta es una auténtica regresión logística de bolsa de palabras, solo que con pesos asignados a mano en lugar de pesos aprendidos de datos de entrenamiento etiquetados.

¿Cuál es la diferencia entre la puntuación por bolsa de palabras y un proceso real de PLN en producción?

La regresión logística de bolsa de palabras, tal como se muestra aquí, fue el enfoque dominante para la clasificación de texto durante aproximadamente dos décadas antes del aprendizaje profundo, y las herramientas ligeras de tecnología legal todavía hoy usan TF-IDF más regresión logística o SVM lineales porque son rápidas, auditables y baratas de ejecutar sobre miles de documentos. Los sistemas de revisión de contratos en producción cada vez más añaden encima un codificador transformer (como un BERT ajustado o un LLM de dominio legal), que capta el orden de las palabras, la negación y el contexto que un modelo de bolsa de palabras pasa completamente por alto; por ejemplo, no puede distinguir "el Proveedor no será responsable" de "el Proveedor será responsable" porque "no" rara vez tiene un peso alto por sí solo. Esta simulación mantiene el modelo deliberadamente simple para que cada término que contribuye siga siendo visible.

¿Por qué algunas palabras como "límite" o "notificación" reducen la puntuación de riesgo en lugar de aumentarla?

El riesgo contractual no depende solo de la presencia de conceptos peligrosos, sino de si esos conceptos están limitados. Una cláusula de responsabilidad que menciona "responsabilidad" y "daños" trata inherentemente sobre la asignación de riesgo, pero si también contiene "límite", "limitado" o "máximo", eso indica que las partes negociaron un tope, lo que reduce significativamente la exposición a la baja. Del mismo modo, los períodos de "subsanación" y de "notificación" adecuada en una cláusula de rescisión dan a la contraparte la oportunidad de solucionar un problema antes de que el contrato termine, lo cual es sustancialmente menos arriesgado que una rescisión inmediata. Esta simulación codifica ese matiz directamente como coeficientes negativos en esos tokens específicos.

¿Qué rastrean en realidad las categorías de indemnización, rescisión y responsabilidad?

Cada token del vocabulario está etiquetado con una de cuatro categorías: indemnización (indemnizar, mantener indemne, defender, indemnizado), rescisión (rescindir, conveniencia, sin causa, perpetuo), responsabilidad (ilimitado, sin límite, daños consecuentes, renunciar, exonerar) o general (incumplimiento, penalización, decomiso, arbitraje). Para cada cláusula, la simulación suma por separado los coeficientes de los tokens encontrados dentro de cada categoría, y la categoría con la subpuntuación positiva más alta se convierte en la etiqueta de "principal impulsor de riesgo" de esa cláusula, mostrada en el panel resaltado. Una cláusula puede puntuar alto en general y aun así tener una categoría claramente dominante, lo que refleja cómo las herramientas reales de revisión de contratos clasifican las cláusulas señaladas en la cola de un abogado.

¿Cómo se genera el mapa de calor de tokens, y es una atribución real y no solo decoración?

Dado que el modelo es una suma lineal de coeficientes por token, la contribución exacta de cualquier token individual a la puntuación final es simplemente el coeficiente de ese token (o coeficiente × recuento, para tokens repetidos); no se necesita ninguna aproximación ni paso de explicación posterior, a diferencia de métodos de atribución como SHAP o los gradientes integrados que se requieren para modelos no lineales. El mapa de calor representa la opacidad de fondo y el matiz de cada token en proporción directa a su coeficiente con signo: colores cálidos para pesos positivos (que aumentan el riesgo), colores fríos para pesos negativos (que lo reducen), y gris neutro para tokens sin peso. Lo que ves es el término aritmético literal en la suma de entrada de la sigmoide, no un efecto visual simulado.

¿Qué controla el control deslizante del umbral de riesgo, y cómo cambia el recuento de señalizaciones al moverlo?

El clasificador siempre genera una probabilidad de riesgo continua entre 0 y 1 para cada cláusula; el control deslizante del umbral fija el punto de corte por encima del cual una cláusula se etiqueta como "señalada" en lugar de "despejada". Bajar el umbral señala más cláusulas (mayor exhaustividad, más falsos positivos en cláusulas límite), mientras que subirlo señala menos cláusulas, pero con más confianza en su riesgo (mayor precisión, aunque puede escapar algo de riesgo real sin señalar). Este es el mismo compromiso entre precisión y exhaustividad que enfrenta todo clasificador binario en producción, y los equipos de tecnología legal suelen ajustar este umbral contra una muestra etiquetada de contratos previamente revisados en lugar de elegirlo arbitrariamente.

¿Por qué el gráfico de riesgo a nivel de documento sigue cambiando de forma a medida que se procesan las cláusulas?

El gráfico en curso traza la puntuación de riesgo por cláusula en el orden en que las cláusulas pasan por el clasificador, más una línea de promedio móvil acumulado. Como el contrato sintético intercala deliberadamente texto estándar de bajo riesgo (definiciones, notificaciones, ley aplicable) con cláusulas de alto riesgo (indemnización sin límite, rescisión unilateral por conveniencia), la línea por cláusula oscila bruscamente mientras que la línea de promedio móvil suaviza esas oscilaciones y converge hacia el perfil de riesgo general del documento a medida que se acumulan más cláusulas, exactamente el patrón que produce un trabajo real de revisión de contratos por lotes al escanear cláusula por cláusula.

¿Podría un abogado confiar en la práctica en un modelo como este, o es solo con fines ilustrativos?

Un modelo de bolsa de palabras ponderado a mano como este no es algo que un despacho desplegaría tal cual: los coeficientes aquí se eligieron por claridad pedagógica, no ajustados a un conjunto de datos etiquetado de contratos reales, y el vocabulario es demasiado pequeño para captar la enorme variedad de redacción que usan los contratos reales. En la práctica, este tipo de modelo lineal se usa como un filtro rápido de triaje de primera pasada, entrenado con miles de cláusulas etiquetadas por auxiliares jurídicos, situado delante de un reordenador basado en transformer más lento y preciso que un revisor humano comprueba antes de que se confíe legalmente en nada. El valor central de la versión lineal simple es que cada señalización es totalmente explicable, exactamente lo que visualiza esta simulación.

⚙ Bajo el capó

Cada cláusula se tokeniza y se puntúa frente a un vocabulario legal ponderado de ~45 términos; la suma ponderada más el sesgo pasa por una sigmoide real para producir una probabilidad de riesgo, con los coeficientes por token representados directamente como un mapa de calor de atribución codificado por color.

PLNRegresión LogísticaBolsa de PalabrasAtribución de TokensTecnología Legal

3D · Motor Three.js / WebGL · Objetivo de 60 FPS · Funciona totalmente en el cliente, sin instalación

¿Qué encontraste?

Añadir pasos de reproducción (opcional)