(⏱️ Tiempo de lectura: 6:30 minutos)
En el artículo anterior pusimos a prueba la capacidad de la IA para responder a algunas preguntas del examen de selectividad de Biología de junio de 2024.
Anteriormente ya habíamos experimentado con el uso de ChatGPT para la corrección de una tarea entregada en formato digital. En este artículo vamos a explorar el uso de los diferentes modelos de IA para la corrección de las preguntas escritas por un estudiante humano, aplicando la capacidad de «visión» que han incorporado varios de los modelos en las últimas actualizaciones.
La corrección de actividades, tests y exámenes mediante los modelos de IA puede tener en el futuro una aplicación práctica muy interesante en educación, ya que puede traer un ahorro sustancial de tiempo y aportar una evaluación más objetiva de estas pruebas.

Calificación de una prueba de selectividad con IA
Para poner a prueba la capacidad de los modelos de IA, hemos usado las respuestas manuscritas de un buen estudiante universitario que hace un par de años había realizado (y superado) esta prueba de selectividad completa. Son las mismas respuestas que ya usamos en el artículo anterior para compararlas con las proporcionadas por los modelos de IA.
✅ Para simplificar el proceso, en lugar de usar todo el examen, del mismo modo que hicimos en el experimento de contestar las preguntas, hemos seleccionado una pregunta de cada grupo hasta un total de 3.
✅ Las respuestas del estudiante se pasaron en forma de imagen (fotografía realizada con el móvil) a los 4 modelos de IA más conocidos que actualmente permiten procesar estas imágenes usando el modo de «visión»: Gemini, ChatGPT-4o, Claude-3 y MS Copilot.
✅ El prompt usado para acompañar estas imágenes e indicarle a la IA la tarea a completar ha sido este:
PROMPT
Actúa como profesor de Biología en Bachillerato en España.
Necesito asistencia para calificar la respuesta de un estudiante a una pregunta del examen de acceso a la universidad de la asignatura de Biología.
Para ello, te voy a pasar una fotografía con una imagen con las respuestas de un estudiante a esa pregunta que debes corregir siguiendo estos criterios:
"
C.2. Total 1 punto
a) Fagocitosis - 0,2 puntos
b) Células animales - 0,1 puntos
c) A: lisosoma; B: fagosoma - 0,3 puntos
d) Digestión celular (degradando material de origen externo o interno) - 0,3 puntos
e) Complejo de Golgi - 0,1 puntos
"
Tu tarea consiste en analizar la respuesta del estudiante y calificar la pregunta sobre los puntos totales teniendo en cuenta los puntos parciales de cada apartado.
Debes ir apartado tras apartado y explicar los aspectos que están bien de la respuesta del estudiante y las partes que son erróneas.
También has de proporcionar una calificación numérica total de la pregunta sumando las calificaciones parciales de cada apartado.
IMPORTANTE: No se trata de que tú respondas las preguntas, sino que evalúes las respuestas de acuerdo a los criterios de corrección proporcionados.
✅ El modelo de MS Copilot tiene tres estilos de conversación. Tras hacer algunos ensayos previas decidimos poner a prueba la corrección usando el modo «equilibrado».
✅ El examen de selectividad se evalúa sobre un total de 10 puntos, pero la selección de 3 preguntas hace que la calificación total de esta prueba se haya hecho sobre un total de 4 puntos (1ª pregunta, 2 puntos; 2ª y 3ª preguntas: 1 punto cada una). Posteriormente se transformó la calificación para que resulte más comprensible.
✅ Como ya comentamos en el artículo anterior, las respuestas del estudiante se pasaron a Cristina Flores, creadora del canal de YouTube BioEsosfera, profesora de Biología actualmente en activo y con experiencia en corrección de este tipo de pruebas, para que la calificara siguiendo los criterios marcados y poder compararse esta calificación con la que proporcionaron los 4 modelos de IA. Agradecemos su colaboración en este experimento.
Preguntas, criterios, respuestas del estudiante y calificación de los modelos
1. Pregunta de concepto
PREGUNTA A.3
a) Defina fermentación [0,5] e indique el lugar de la célula donde se realiza [0,1].
b) Cite dos tipos de fermentación [0,4], indicando en cada caso un tipo de célula u organismo que la realiza [0,4].
c) Explique la diferencia entre la rentabilidad energética de la fermentación y de la respiración celular [0,6]. Puntuación total: 2 puntos


CORRECCIÓN REALIZADA POR LOS MODELOS DE IA
| APARTADO | Gemini | ChatGPT-4o | Claude-3 | MS Copilot | Profesor |
| a | 0,3 | 0,1 | 0,1 | 0,1 | 0,3 |
| b | 0,2 | 0,8 | 0,8 | 0,4 | 0,8 |
| c | 0,4 | 0,6 | 0,4 | 0,6 | 0,6 |
| TOTAL (sobre 2) | 0,9 | 1,5 | 1,3 | 1,1 | 1,7 |
2. Pregunta de razonamiento
PREGUNTA B.1
En el laboratorio se analiza la secuencia de nucleótidos del genoma de varios agentes patógenos, y la única información disponible es el porcentaje de adenina presente en las mismas, y el tipo de ácido nucleico de dichos patógenos. Las muestras son:
a) viroide aislado de planta de aguacate, 29% adenina, ARN monocatenario;
b) coronavirus aislado de secreción nasal humana, 31% adenina, ARN monocatenario;
c) bacteria Salmonella enteritidis aislada de muestras de heces humanas, 22% adenina, ADN bicatenario;
d) Parvovirus aislado de epitelio intestinal de perro, 27% adenina, ADN monocatenario;
e) Birnavirus aislado de piel de gallina, 32% adenina, ARN bicatenario.
Teniendo en cuenta esta información, deduzca de manera razonada, cuando sea posible, el porcentaje de las restantes bases nitrogenadas en cada una de las muestras biológicas [1]. Puntuación total: 1 punto


CORRECCIÓN REALIZADA POR LOS MODELOS DE IA
| APARTADO | Gemini | ChatGPT-4o | Claude-3 | MS Copilot | Profesor |
| a | 0,2 | 0,2 | 0,2 | 0,2 | 0,2 |
| b | 0,2 | 0,2 | 0,2 | 0,2 | 0,2 |
| c | 0 | 0,2 | 0,15 | 0 | 0,2 |
| d | 0,2 | 0,2 | 0,1 | 0 | 0,2 |
| e | 0,2 | 0 | 0,2 | No detectado | 0,2 |
| TOTAL (sobre 1) | 0,8 | 0,8 | 0,85 | 0,4 | 1 |
3. Pregunta de interpretación de imagen




CORRECCIÓN REALIZADA POR LOS MODELOS DE IA
| APARTADO | Gemini | ChatGPT-4o | Claude-3 | MS Copilot | Profesor |
| a | 0,2 | 0,2 | 0,2 | 0,2 | 0,2 |
| b | 0,1 | 0,1 | 0,1 | 0,05 | 0,1 |
| c | 0,3 | 0,15 | 0,15 | 0 | 0,3 |
| d | 0,1 | 0,15 | 0,15 | 0,15 | 0,3 |
| e | 0 | 0 | 0 | 0 | 0 |
| TOTAL (sobre 1) | 0,7 | 0,6 | 0,6 | 0,4 | 0,9 |
CURSO DE FORMACIÓN ONLINE: HERRAMIENTAS DE IA PARA PROFESORES
✅ En este curso se exploran, a lo largo de más de 3 horas de videos, las principales herramientas de Inteligencia Artificial que han surgido y que se pueden aplicar a tareas docentes: chatbots educativos, generación de imágenes, avatares, cómics, canciones, videos y animaciones, redacción de tests y exámenes y muchas otras más.
✅ Este curso está disponible en las plataformas Udemy (19,99€) y G-Talent (20,95€), y ambas tienen frecuentes cupones, promociones y descuentos 😉 )
Calificación total y conclusiones
Haciendo balance de la puntuación asignada por cada uno de los modelos de IA y por el profesor en cada una de las preguntas, encontramos esta tabla:
| PREGUNTA | Gemini | ChatGPT-4o | Claude-3 | MS Copilot | Profesor |
| A. Concepto | 0,9 | 1,5 | 1,3 | 1,1 | 1,8 |
| B. Razonamiento | 0,8 | 0,8 | 0,85 | 0,4 | 1 |
| C. Imagen | 0,7 | 0,6 | 0,6 | 0,4 | 0,9 |
| TOTAL (sobre 4) | 2,4 | 2,9 | 2,75 | 1,9 | 3,6 |
| TOTAL (sobre 10) | 6 | 7,25 | 6,875 | 4,75 | 9 |
✅ La diferencia entre las calificaciones de los modelos de IA y la calificación correcta asignada por una profesora experta es muy grande.
✅ Resulta interesante revisar las correcciones de los modelos de IA, porque ocurren problemas a varios niveles: no detectan un apartado de una pregunta, entienden correctamente el texto pero lo califican de forma errónea, encuentran matices en algún apartado de algunas respuesta como para justificar calificarlo con más valores decimales, suman erróneamente los puntos de los apartados de las preguntas…
✅ Algunos modelos aportan comentarios sobre los aspectos correctos e incorrectos de las preguntas contestadas, lo cual es una idea interesante que se puede desarrollar ya que los docentes no siempre tenemos tiempo de redactar estas anotaciones que mejoran la evaluación de los estudiantes al proporcionarles mayor información sobre aciertos y errores.
✅ Desde el punto de vista práctico, es muy lento. Tal vez en el futuro esta corrección y calificación se pueda automatizar con modelos o herramientas específicas, pero actualmente es más rápido (además de que, como hemos visto, es más fiable) realizar la corrección por un profesor experto.
👉 Recopilación de las correcciones realizadas por los modelos de IA
Estamos muy interesados en cualquier prueba o experimento que hagas sobre el uso de cualquier modelo de IA para corregir, calificar y evaluar las tareas o pruebas de los estudiantes de forma automática. Nos puedes dejar tus ideas en los comentarios del artículo o a través de redes sociales.
⚠️ Los enlaces de esta página y de toda la web pueden contener código de afiliados de Amazon o de otras empresas. Esto significa que recibimos una comisión por cada compra de producto o servicio sin que cambie el precio de venta para el comprador.










