InicioIA y Aprendizaje AutomáticoEstimador de Calidad de Traducción

🌐 Estimador de Calidad de Traducción — Alineación de Embeddings en Vivo

Puntúa pares de frases traducidas automáticamente por su calidad usando una alineación real de embeddings interlingüísticos, observando cómo la puntuación de confianza sigue el sutil desplazamiento de significado en tiempo real.

IA y Aprendizaje Automático3DModerado60 FPS
ai-translation-quality-estimation ↗ Abrir independiente

Acerca de esta simulación

Los sistemas de traducción automática producen resultados en milisegundos, pero saber si ese resultado es fiable es un problema aparte y más difícil — que suele resolverse mediante la estimación de calidad de traducción (QE), que puntúa una traducción sin necesitar una referencia humana. Esta simulación construye un pequeño pipeline de QE totalmente transparente: las palabras de origen y traducidas se sitúan en un espacio de embeddings sintético compartido donde los pares de traducción verdaderos quedan cerca entre sí, los vectores de frase se forman promediando embeddings de palabras (y pares de palabras), y la puntuación de calidad es la similitud coseno real entre los dos vectores de frase — exactamente la comparación que realizan las métricas QE reales basadas en embeddings.

🔬 Qué se muestra

Seis pares de frases origen/traducción, cada palabra mapeada a un vector determinista de 20 dimensiones. Una palabra y su traducción correcta son copias con ruido del mismo vector "concepto" compartido — un sustituto de juguete de la alineación de embeddings interlingüísticos. El diagrama de dispersión PCA en vivo proyecta cada vector de palabra sobre sus dos direcciones de mayor varianza; la línea discontinua entre los dos puntos centroides más grandes es la distancia de alineación a nivel de frase, y el gráfico inferior sigue la puntuación de calidad resultante de 0 a 100 a lo largo del tiempo.

🎮 Cómo usarlo

Elige un par de frases, luego arrastra el deslizador de Cantidad de desplazamiento mientras está seleccionado un modo de desplazamiento — Sustituir, Reordenar u Omitir — y observa cómo responden al instante la puntuación de calidad, la similitud coseno y el diagrama PCA. "Regenerar patrón de desplazamiento" vuelve a aleatorizar qué palabras se ven afectadas en cada nivel de desplazamiento; "Animar desplazamiento" sube y baja la cantidad automáticamente para que puedas ver cómo el gráfico de tendencia de la puntuación construye un historial completo.

💡 ¿Sabías que...?

Como el vector de frase es un promedio de bolsa de embeddings, el reordenamiento puro (manteniendo todas las palabras pero mezclando sus posiciones) degrada la puntuación mucho menos que sustituir o eliminar palabras de contenido — la misma asimetría que se observa en las métricas de traducción automática reales basadas en embeddings, que son mucho mejores detectando significado mal traducido que penalizando el orden de las palabras por sí solo.

Preguntas frecuentes

¿Qué es la estimación de calidad de traducción (QE)?

La estimación de calidad de traducción predice qué tan buena es una traducción automática sin acceso a una traducción de referencia humana. Los sistemas QE reales (como COMET-QE u OpenKiwi) pasan la frase de origen y la traducción automática por un codificador multilingüe y comparan los embeddings resultantes — las frases que significan lo mismo caen cerca unas de otras en el espacio de embeddings compartido, mientras que las traducciones erróneas se alejan. Esta simulación construye una versión pequeña y transparente de esa misma idea: embeddings de palabras sintéticos, un espacio de conceptos interlingüístico compartido y una puntuación real de similitud coseno.

¿Cómo funciona aquí el espacio de embeddings sintético?

Cada concepto de palabra recibe un vector determinista de 20 dimensiones generado a partir de un hash con semilla de su nombre. Una palabra del idioma de origen y su traducción correcta se construyen ambas añadiendo un pequeño ruido independiente a ese mismo vector de concepto compartido — imitando cómo la alineación real de embeddings interlingüísticos (por ejemplo, MUSE, LASER, o una correspondencia inducida por diccionario bilingüe) sitúa los pares de traducción verdaderos cerca uno del otro pese a ser palabras superficialmente distintas. Una palabra distractora no relacionada recibe su propio vector independiente, de modo que sustituir la palabra incorrecta hace que el vector de la traducción se aleje del origen.

¿Cómo se calcula el vector de la frase a partir de los vectores de palabras?

Cada vector de frase es un promedio ponderado de sus vectores de palabras (80%) y de sus vectores de pares de palabras adyacentes, o bigramas (20%). Promediar vectores de palabras es la representación clásica de frase como bolsa de embeddings; añadir vectores de bigramas da a la representación cierta sensibilidad al orden de las palabras, ya que reordenarlas cambia qué bigramas aparecen aunque las mismas palabras sigan presentes. Este es el mismo compromiso que hacen los embeddings de frase reales al estilo fastText o SIF entre simplicidad y sensibilidad al orden.

¿Qué mide realmente la puntuación de calidad?

La puntuación de calidad es la similitud coseno entre el vector de la frase de origen y el vector de la frase traducida, reescalada desde su rango típico de −0.5…0.9 a una escala de 0–100. La similitud coseno mide el ángulo entre dos vectores independientemente de su longitud, que es exactamente lo que usan las métricas QE basadas en embeddings para comparar el significado ignorando diferencias superficiales de escala. Una traducción fiel mantiene este ángulo pequeño (puntuación alta); sustituir, omitir o reordenar suficientes palabras ensancha el ángulo y la puntuación cae en tiempo real a medida que mueves el deslizador de desplazamiento.

¿Por qué la sustitución, el reordenamiento y la omisión afectan la puntuación de forma diferente?

Sustituir una palabra cambia su vector por uno no relacionado, alejando bruscamente el promedio del origen — unas pocas sustituciones ya muestran una gran caída. Omitir palabras reduce el promedio de la frase hacia lo que queda, lo que también degrada la puntuación una vez que falta suficiente contenido, pero una sola palabra funcional ausente importa menos. Reordenar mantiene sin cambios el vector de cada palabra en el promedio de la frase, así que solo se manifiesta a través del componente de bigramas — un reflejo real de por qué las métricas al estilo bolsa de palabras son menos sensibles al orden de las palabras que a la traducción errónea real del contenido.

¿Qué muestra la proyección PCA en el panel superior?

El panel superior toma cada vector de palabra en las frases actuales de origen y traducción (todos de 20 dimensiones) y los proyecta sobre las 2 direcciones de mayor varianza mediante análisis de componentes principales, calculado en vivo por iteración de potencias sobre la matriz de covarianza. Esta es la misma técnica de reducción de dimensionalidad usada para visualizar embeddings reales de palabras y frases (por ejemplo, graficar vectores de BERT o word2vec). Los dos puntos más grandes son los centroides de las frases; la línea discontinua entre ellos es el análogo visual de la distancia de alineación mostrada en el panel de estadísticas.

¿Es así como funcionan realmente los sistemas de QE de traducción automática en producción?

El mecanismo central — comparar los embeddings de origen y traducción con similitud coseno en un espacio interlingüístico compartido — es genuinamente cómo operan los sistemas de QE sin referencia y de recuperación interlingüística. Lo que se simplifica aquí es el propio embedding: los sistemas de producción usan codificadores transformadores multilingües profundos entrenados con miles de millones de palabras, mientras que esta simulación usa pequeños vectores pseudoaleatorios deterministas para que todo el proceso siga siendo inspeccionable y reproducible en el navegador. La matemática de alineación, promediado y comparación coseno, sin embargo, es la real.

⚙ Bajo el capó

Las palabras de origen y traducción se mapean a un espacio de embeddings sintético compartido de 20 dimensiones; los vectores de frase son promedios ponderados de unigramas y bigramas, y la puntuación de calidad es una similitud coseno real, actualizada en vivo mientras sustituyes, reordenas u omites palabras.

Canvas 2DEmbeddingsCosine SimilarityPCANLP

3D · motor de renderizado Three.js / WebGL · objetivo de 60 FPS · funciona enteramente en el cliente, sin instalación

¿Qué encontraste?

Añadir pasos de reproducción (opcional)