En la sección del profesor productivo en el podcast IA y Educación mostramos los tests y pruebas que se aplican a los modelos de IA para estableces su capacidad.

¿Cuándo admitiremos que una IA es realmente inteligente?
Durante décadas hemos intentado responder a una pregunta aparentemente sencilla: ¿cuándo podremos decir que una máquina es realmente inteligente?
El problema es que, cada vez que una máquina supera una prueba que parecía definitiva, dejamos de considerarla válida y colocamos la siguiente meta un poco más lejos.
Primero fue conversar como una persona. Después jugar al ajedrez. Más tarde dominar el Go. Luego escribir, programar, traducir o resolver problemas complejos.
La historia de la inteligencia artificial está llena de metas que parecían imposibles… hasta que dejaron de serlo.
Del test de Turing al ajedrez y el Go
En 1950, Alan Turing propuso una prueba que después conoceríamos como test de Turing. La idea era sencilla: si una persona conversaba por escrito con un humano y una máquina y no era capaz de distinguirlos, quizá podríamos considerar que la máquina mostraba un comportamiento inteligente.
Hoy, los modelos avanzados pueden mantener conversaciones largas y complejas sobre casi cualquier tema. Y, sin embargo, conversar ya no parece suficiente.
Algo parecido ocurrió con el ajedrez.
En 1997, Deep Blue derrotó al campeón mundial Garry Kasparov. Pero rápidamente apareció una explicación que rebajaba el logro: no era inteligencia, sino capacidad de cálculo.
Después llegó el Go, mucho más complejo desde el punto de vista de las posibilidades disponibles.
En 2016, AlphaGo derrotó a Lee Sedol por cuatro partidas a una y realizó movimientos que sorprendieron incluso a expertos humanos.
Pero tampoco fue suficiente. AlphaGo jugaba extraordinariamente bien al Go, sí, pero apenas sabía hacer otra cosa.
La meta volvió a desplazarse.
Cuando las máquinas empezaron a dominar el lenguaje
Durante años, el lenguaje complejo pareció uno de los grandes refugios de la inteligencia humana.
Escribir, resumir, traducir, argumentar o crear historias parecían capacidades muy difíciles de reproducir mediante una máquina.
La aparición de los grandes modelos de lenguaje cambió ese escenario.
Sistemas actuales pueden escribir textos, programar, analizar documentos, interpretar imágenes, utilizar herramientas o resolver problemas de muchos tipos.
Entonces surgió una nueva objeción: estos modelos «simplemente predicen la siguiente palabra».
La descripción puede ser técnicamente válida, pero resulta curiosa cuando esa máquina que «solo predice palabras» es capaz de producir en segundos un informe, una explicación o un programa que muchas personas tardarían mucho más en elaborar.
Aquí aparece una paradoja importante.
¿Exigimos más a la IA que a los humanos?
Para decidir si una inteligencia artificial es realmente inteligente, empezamos a exigirle capacidades que probablemente la mayoría de las personas tampoco podría demostrar simultáneamente.
Queremos que programe, resuelva matemáticas avanzadas, interprete artículos científicos, traduzca idiomas y analice documentos especializados.
Y cuando lo consigue respondemos: «Sí, pero no entiende realmente lo que hace».
Si aplicáramos el mismo criterio a una persona, tendríamos que pedirle que aprobara a la vez exámenes de programación, física, medicina y filosofía para considerarla inteligente.
Probablemente no aceptaríamos ese criterio para evaluar a un ser humano.
Con las máquinas, sin embargo, lo hacemos constantemente.
Los benchmarks y el problema de los exámenes demasiado fáciles
Para comparar modelos se utilizan los llamados benchmarks, pruebas de matemáticas, ciencias, programación, razonamiento o comprensión.
Pero tienen un problema que cualquier profesor reconoce enseguida: si todos los alumnos empiezan a obtener sobresalientes, el examen deja de servir para distinguir niveles.
Eso ha ocurrido con distintos benchmarks de inteligencia artificial.
A medida que los modelos mejoran, tenemos que crear pruebas más difíciles. Algunas contienen ya problemas que la mayoría de los seres humanos tampoco podría resolver.
Y entonces aparece una pregunta incómoda: ¿tiene sentido exigir a una máquina pruebas que nosotros mismos probablemente suspenderíamos?

ARC-AGI y la capacidad de enfrentarse a lo desconocido
Una propuesta especialmente interesante es ARC-AGI, creado originalmente por François Chollet.
Su planteamiento no consiste tanto en comprobar cuánto sabe un modelo, sino en evaluar qué hace cuando se encuentra ante un problema nuevo.
Se presentan situaciones abstractas cuyas reglas debe descubrir.
La pregunta ya no es «¿cuánto sabe?», sino «¿es capaz de comprender algo desconocido y encontrar una solución?»
Las versiones más recientes han avanzado todavía más: los sistemas deben interactuar con pequeños entornos, probar acciones, equivocarse y adaptar su estrategia.
Esto se parece mucho más a una de las características fundamentales que atribuimos a la inteligencia humana: la capacidad de aprender y adaptarnos cuando no sabemos qué hacer.
¿Qué significa realmente AGI?
Aquí aparece otro concepto cada vez más utilizado: AGI, o inteligencia artificial general.
En términos sencillos, sería una IA capaz de aprender, razonar y desenvolverse competentemente en una gran variedad de tareas, en lugar de dominar únicamente una actividad concreta.
El problema es que no existe una definición universalmente aceptada.
¿Debe poder realizar cualquier trabajo intelectual humano? ¿Aprender continuamente? ¿Adaptarse a cualquier situación?
Además, hay una contradicción interesante: ningún ser humano sabe hacer absolutamente de todo.
Un médico puede no saber diseñar un puente. Un ingeniero puede no dominar la historia medieval.
Nuestra inteligencia es general no porque podamos hacerlo todo, sino porque podemos aprender, adaptarnos y transferir conocimientos entre situaciones distintas.
Quizá ese criterio sea también más útil cuando hablamos de inteligencia artificial.
El verdadero reto para la educación
Más allá de discutir si una máquina es o no «realmente inteligente», existe una cuestión mucho más urgente.
¿Qué ocurre con la educación si estos sistemas son capaces de escribir, programar, investigar o resolver problemas cada vez mejor?
La primera pregunta será qué merece la pena aprender.
Que una IA pueda producir una respuesta no significa que los conocimientos dejen de ser importantes. Seguimos necesitándolos para comprender, evaluar, relacionar ideas y detectar errores.
Pero tendremos que distinguir mejor entre lo que merece la pena interiorizar, lo que podemos delegar y lo que necesitamos saber precisamente para utilizar correctamente estas herramientas.
La segunda cuestión será cómo evaluamos.
Si un estudiante dispone de una IA capaz de redactar, resolver ejercicios o corregir errores, el producto final nos dirá cada vez menos sobre lo que realmente sabe.
Probablemente tendremos que prestar más atención al proceso: cómo plantea el problema, qué decisiones toma, cómo verifica las respuestas o cómo utiliza la inteligencia artificial.
Y existe una tercera pregunta todavía más complicada: ¿para qué trabajos estamos preparando hoy a nuestros estudiantes si muchas profesiones pueden cambiar profundamente en pocos años?
No se trata de abandonar los contenidos ni de sustituir la educación por inteligencia artificial.
Se trata de empezar a decidir qué capacidades serán realmente importantes en un mundo en el que humanos y máquinas trabajarán cada vez más juntos.
Una meta que quizá nunca deje de moverse
Llevamos más de setenta años preguntándonos qué tendría que hacer una máquina para que la consideremos inteligente.
Y cada vez que alcanza una de nuestras metas, solemos desplazarla.
Quizá el problema no esté únicamente en las máquinas.
Tal vez nosotros mismos tampoco tengamos demasiado claro qué significa ser inteligente.
Y, desde el punto de vista educativo, quizá haya una pregunta todavía más importante que decidir si hemos alcanzado o no la AGI:
¿Estamos preparando la educación para un mundo en el que estas máquinas serán cada vez más capaces?

⚠️ ATENCIÓN: Este artículo ha sido generado con herramientas de IA. Aunque ha sido revisado por los autores del blog, puede contener errores en su contenido.
