
¿Evaluamos el aprendizaje o el algoritmo?
Por Carlos Barraza Rojas, docente de la Universidad del Alba
Imaginemos que un estudiante recibe las instrucciones para un trabajo, abre su IA predilecta, pega el enunciado y, en segundos, obtiene un texto coherente, bien argumentado y con referencias aparentemente sólidas. Lo entrega, el docente lo lee, lo corrige y le pone nota. Esta escena, cada vez más común en aulas universitarias de todo el mundo, no es un problema aislado de falta de honestidad académica. Es el síntoma visible de algo más profundo. Porque, aunque nos cueste admitirlo, nuestros sistemas de evaluación fueron diseñados para un mundo que ya no existe.
Durante décadas, la evaluación tuvo una premisa simple: si un estudiante produce un buen trabajo, un buen ensayo, un buen informe o una buena respuesta, es porque aprendió. Esto está arraigado en una cultura académica que, en muchos casos, todavía privilegia el producto final prístino, el ensayo perfecto o la respuesta correcta por sobre el proceso que llevó a construirlo. La IA generativa llegó a romperlo todo, ya que hoy podemos obtener un producto de calidad sin que necesariamente exista comprensión, criterio o proceso reflexivo alguno por parte del alumno. A esto, algunos investigadores lo llaman el «efecto caja negra» de la evaluación, ya no sabemos con certeza qué estamos midiendo cuando calificamos un trabajo. El instrumento de evaluación dejó de ser confiable.
El asunto aquí es que la tecnología no es solo una amenaza; también es una oportunidad. Si el problema es que ya no podemos confiar en el producto final como evidencia de aprendizaje, la respuesta no puede ser solo prohibir la IA ni perseguir a los estudiantes con detectores cada vez más falibles. La respuesta es rediseñar qué y cómo evaluamos. Ahí entra la llamada evaluación auténtica: en vez de pedir únicamente un producto terminado, deberíamos evaluar el proceso, la capacidad de justificar decisiones, de transferir lo aprendido a situaciones nuevas, de argumentar por qué se tomó un camino y no otro. Se trata de formar y evaluar lo que algunos autores llaman «juicio evaluativo», que no es más que la capacidad del propio estudiante de reconocer qué es un trabajo de calidad y por qué lo es. Esa habilidad, a diferencia de un texto perfectamente redactado, no se puede generar con un prompt.
Este cambio en la evaluación no es un ajuste cosmético en la academia. Implica repensar instrumentos, capacitar a los docentes, y, sobre todo, aceptar que, lo queramos o no, la IA generativa llegó para quedarse y las universidades que logren integrarla como parte del proceso de aprendizaje, en lugar de tratarla solo como una amenaza a vigilar, estarán mejor preparadas para formar profesionales capaces de pensar con criterio en un mundo donde la información está a un clic de distancia y la IA generativa está desarrollada para estructurar textos por nosotros.
La cuestión que planteo en esta columna no es si debemos permitir el uso de la IA en la educación superior, eso ya ocurre, sino si estamos dispuestos o no a rediseñar nuestros sistemas evaluativos para que midan lo que realmente importa: la cada vez más oculta capacidad humana de pensar.




