🧠 Motor de Aprendizaje Adaptativo — Rastreo de Conocimiento en Vivo
Observa cómo un modelo de rastreo de conocimiento actualiza su estimación del dominio de un estudiante simulado después de cada pregunta respondida, y ve cómo se adapta en tiempo real la siguiente pregunta que elige.
Acerca del Motor de Aprendizaje Adaptativo
Las plataformas de aprendizaje adaptativo como Khan Academy, Duolingo y ALEKS se enfrentan todas al mismo problema de fondo: la comprensión real de un estudiante sobre una habilidad nunca es directamente observable, solo se infiere a partir de un goteo ruidoso de respuestas correctas e incorrectas. El Rastreo Bayesiano de Conocimiento (BKT), el algoritmo detrás de décadas de sistemas de tutoría inteligente, resuelve esto tratando el dominio de cada habilidad como una probabilidad oculta P(L) y actualizándola con la regla de Bayes tras cada intento, usando dos parámetros molestos — adivinanza y desliz — que separan la comprensión genuina de las adivinanzas afortunadas y los errores por descuido. Esta simulación implementa exactamente ese modelo, por completo, para un estudiante simulado que trabaja en cinco habilidades matemáticas independientes, cada una con su propio estado oculto de dominio real y su propia estimación bayesiana en vivo que puedes observar evolucionar pregunta por pregunta.
Cada respuesta simulada ejecuta el auténtico ciclo de cuatro pasos del BKT: una pregunta se selecciona mediante una política adaptativa, la respuesta se extrae de forma estocástica del verdadero estado oculto del estudiante a través de los parámetros de adivinanza/desliz, el propio estado oculto puede transicionar hacia el dominio, y la creencia del modelo se actualiza con la fórmula bayesiana posterior antes de incorporar una transición de tasa de aprendizaje. El gráfico de barras de dominio, el panel de razonamiento de selección y la tendencia continua de precisión/crecimiento de dominio se actualizan todos en vivo a partir de estos cálculos — nada aquí está guionizado ni preanimado.
Qué muestra
Un gráfico de barras en vivo de la probabilidad de dominio por habilidad, actualizado por la regla de Bayes real tras cada respuesta simulada, un panel de selección que muestra exactamente qué habilidad se eligió y por qué, y un gráfico continuo de precisión móvil y crecimiento medio de dominio a lo largo de la sesión.
Cómo usarlo
Avanza las preguntas una por una o activa la ejecución automática, ajusta los parámetros de adivinanza/desliz/tasa de aprendizaje para ver cuán indulgente o estricto es el modelo, y cambia la política de selección para comparar la práctica adaptativa de habilidad-más-débil-primero frente a una línea base aleatoria.
¿Sabías que?
Plataformas adaptativas reales como Khan Academy y ALEKS remontan su lógica de seguimiento de dominio al mismo algoritmo de Rastreo Bayesiano de Conocimiento de Corbett y Anderson de 1995 que esta simulación implementa directamente.
Preguntas Frecuentes
¿Qué es el Rastreo Bayesiano de Conocimiento, y qué supone sobre un estudiante?
El Rastreo Bayesiano de Conocimiento (BKT), introducido por Corbett y Anderson en 1995, modela el conocimiento de un estudiante sobre una habilidad concreta como una única variable binaria oculta: dominada o aún no dominada. Nunca observa este estado directamente — solo ve si cada respuesta fue correcta o incorrecta — y mantiene una probabilidad P(L) de que la habilidad esté actualmente dominada, actualizando esa probabilidad con la regla de Bayes tras cada intento. Esta simulación ejecuta exactamente ese modelo a lo largo de cinco habilidades independientes para un estudiante simulado: cada habilidad tiene su propio estado oculto de dominio real (que el modelo nunca puede ver) y su propia estimación P(L) en vivo (que puedes observar moverse tras cada pregunta), de modo que puedes comparar directamente la creencia del modelo con la verdad fundamental que está tratando de inferir.
¿Qué significan los parámetros de adivinanza y desliz, y por qué el porcentaje de aciertos no puede medir el dominio?
Adivinanza (g) es la probabilidad de que un estudiante que NO domina una habilidad responda correctamente de todos modos — por ejemplo, detectando un patrón en opciones de respuesta múltiple. Desliz (s) es la probabilidad de que un estudiante que SÍ domina una habilidad responda incorrectamente de todos modos — un error por descuido. Debido a estos dos efectos, una única respuesta correcta no es prueba de dominio y una única respuesta incorrecta no es prueba de ignorancia: el porcentaje de aciertos por sí solo confunde la habilidad con la suerte. El BKT separa explícitamente ambas cosas manteniendo la adivinanza y el desliz como parámetros molestos fijos, e infiriendo la probabilidad de dominio oculta que mejor explica toda la secuencia de respuestas correctas e incorrectas, no solo la última.
¿Cómo funciona exactamente la actualización bayesiana tras cada respuesta?
Antes de una pregunta, el modelo tiene una P(L) previa de que la habilidad está dominada. Si la respuesta es correcta, la posterior es P(L|correcta) = [P(L)·(1−s)] / [P(L)·(1−s) + (1−P(L))·g] — la probabilidad de acertar por dominio real, dividida entre la probabilidad total de acertar (por dominio o por una adivinanza afortunada). Si la respuesta es incorrecta, la posterior es P(L|incorrecta) = [P(L)·s] / [P(L)·s + (1−P(L))·(1−g)] — la probabilidad de un desliz, dividida entre la probabilidad total de fallar. Esta simulación calcula exactamente estas dos fórmulas después de cada pregunta simulada y muestra los números de dominio antes y después en el panel «Última pregunta».
¿Por qué se aplica una transición de tasa de aprendizaje después de cada pregunta, no solo de las correctas?
El BKT asume que un estudiante puede aprender del propio acto de intentar responder una pregunta, sin importar si acertó — por la retroalimentación, por trabajar el problema, o simplemente por la exposición repetida. Tras calcular la posterior bayesiana a partir de la corrección observada, el modelo aplica un paso más: P(Lsiguiente) = P(Lposterior) + (1−P(Lposterior))·T, donde T es la probabilidad de tasa de aprendizaje (transición) de que un estudiante no dominante cruce hacia el dominio en este intento. Fundamentalmente, el BKT asume que el aprendizaje es unidireccional — nunca se asume que el dominio se olvide — así que T solo empuja la estimación hacia arriba. Esto es exactamente lo que controla el control deslizante de tasa de aprendizaje en esta simulación, y puedes observar cómo ajustes más altos acercan las estimaciones de dominio al 100% mucho más rápido.
¿Cómo decide la política de selección adaptativa qué habilidad probar a continuación?
La política «Habilidad más débil primero» simplemente formula una pregunta de la habilidad que actualmente tiene la P(L) más baja, concentrando la práctica donde el modelo cree que el estudiante más la necesita — esta es la idea central detrás de los sistemas adaptativos basados en dominio como el motor de práctica de Khan Academy y ALEKS. «Ponderada por incertidumbre» hace lo mismo de forma probabilística, muestreando habilidades con una probabilidad proporcional a (1 − P(L)), de modo que las habilidades débiles son favorecidas pero no forzadas de forma determinista. «Turno rotativo» recorre las habilidades en un orden fijo sin importar el dominio, y «Aleatorio» elige de forma uniforme al azar como línea base. Alternar entre estas políticas mientras se observa el gráfico de barras de dominio hace directamente visible la ganancia de eficiencia de la adaptatividad: el enfoque de habilidad más débil primero alcanza el dominio total en las cinco habilidades en notablemente menos preguntas que la línea base aleatoria.
¿Por qué puede un estudiante responder correctamente sin haber dominado una habilidad, y viceversa?
Esto es exactamente lo que modelan los parámetros de adivinanza y desliz, y por eso el BKT rastrea una probabilidad en lugar de un único hecho observado. Un estudiante con estado de dominio real «no dominado» aún puede responder correctamente con probabilidad g (una adivinanza afortunada, o un conocimiento parcial que en esta ocasión funciona) — la simulación literalmente lanza esta moneda cada vez que se le pregunta algo a un estudiante simulado no dominante. Simétricamente, un estudiante realmente dominante responde incorrectamente con probabilidad s (un desliz momentáneo, una mala lectura de la pregunta, o una errata). Como ambos se simulan como sorteos aleatorios genuinos — no resultados guionizados —, verás ocasionalmente aciertos afortunados en habilidades débiles y fallos ocasionales de mala suerte en habilidades que el modelo ya estima como muy dominadas, exactamente como ocurriría con un estudiante real.
¿Cuáles son las limitaciones conocidas del BKT frente a modelos de rastreo de conocimiento más recientes?
Las suposiciones del BKT son simplificaciones fuertes: trata el dominio de cada habilidad como totalmente binario e independiente de cualquier otra habilidad, ignora el crédito parcial y el tiempo de respuesta, y asume una tasa fija de adivinanza/desliz en lugar de una que varíe según la dificultad de la pregunta o el estudiante. Sistemas de investigación modernos como el Rastreo Profundo de Conocimiento (DKT, que usa redes neuronales recurrentes) y extensiones bayesianas con parámetros de dificultad por ítem (más cercanas a la Teoría de Respuesta al Ítem) relajan estas suposiciones y a menudo se ajustan más fielmente a los datos reales de los estudiantes, a costa de ser mucho menos interpretables — no se puede leer una única probabilidad transparente de que el estudiante domina las fracciones a partir del estado oculto de una red neuronal como sí se puede con el BKT. Esa interpretabilidad es precisamente la razón por la que el BKT, a pesar de tener tres décadas de antigüedad, sigue ampliamente desplegado hoy en sistemas de tutoría de producción reales.
Cinco habilidades llevan cada una un estado oculto de dominio real y una estimación bayesiana de rastreo de conocimiento P(L) en vivo; cada respuesta simulada ejecuta una actualización genuina de regla de Bayes de adivinanza/desliz seguida de una transición de tasa de aprendizaje, y la política de selección adaptativa reordena las cinco habilidades según sus estimaciones en vivo para elegir la siguiente pregunta — renderizado como dos gráficos en un canvas fuera de pantalla (barras de dominio y una tendencia continua de precisión/dominio) cargados como planos CanvasTexture bajo una cámara ortográfica de Three.js.
3D · Renderizador Three.js / WebGL · objetivo 60 FPS · funciona totalmente en el cliente, sin instalación