ChatGPT elevó las notas de los trabajos. El estudio de Bocconi no midió el aprendizaje

Un ensayo con 1.053 estudiantes encontró que ChatGPT mejoró las recomendaciones puntuadas, pero su métrica de originalidad era computacional y el estudio no midió el aprendizaje posterior.

Comparte este artículo

Dar acceso a ChatGPT a los estudiantes elevó la puntuación de calidad en una tarea empresarial muy especificada. Un breve ejercicio de razonamiento causal produjo algo diferente: empujó a los estudiantes hacia ideas más variadas que la rúbrica estándar de la tarea no recompensaba.

Ese es el resultado útil de un nuevo experimento con 1.053 estudiantes de primer curso. No es evidencia de que ChatGPT mejorara el aprendizaje. El ensayo midió un único resultado asistido producido en unos 45 minutos; no comprobó qué entendían los estudiantes, qué retenían ni si podían transferirlo a una tarea posterior sin el modelo.

La lección práctica tiene que ver con la medición. Una evaluación que solo registra la respuesta terminada puede premiar el acabado convencional mientras pasa por alto la originalidad, el razonamiento y la comprensión independiente. Los educadores —y los equipos que evalúan trabajo de conocimiento asistido por IA— necesitan medidas separadas para esos resultados.

Qué aleatorizó el estudio de pensamiento crítico con ChatGPT

El working paper de agosto describe un ensayo controlado aleatorizado 2×2 preregistrado y realizado en noviembre de 2025. Los investigadores asignaron 13 clases intactas de tres programas de grado a una de cuatro condiciones. Fue una aleatorización por conglomerados a nivel de clase, no una asignación aleatoria individual.

GrupoNIntervenciónResultado
Control249Juego placebo; sin ChatGPTLínea base
Formación causal256Juego de razonamiento; sin ChatGPTIdeas más diversas; sin mayor puntuación de la rúbrica
ChatGPT197GPT-4o disponibleLa puntuación estimada de la rúbrica subió 0,862 puntos
Ambos351Formación y GPT-4o disponiblesConservó gran parte de cada patrón distintivo

Después, todos los estudiantes recibieron el mismo caso empresarial: escribir unas 180 palabras recomendando formas de aumentar el conocimiento y el uso por parte de los antiguos alumnos de la tienda de productos de la universidad. Veinte estudiantes de máster formados calificaron cada respuesta, con tres evaluadores por entrega, usando una rúbrica de cinco puntos derivada de dos conceptos de marketing: conocimiento y uso. Tres expertos del área también proporcionaron recomendaciones de referencia.

La unidad de la tarea importa. Se aleatorizaron 13 clases, no 1.053 estudiantes individuales. Los autores agruparon sus errores estándar y añadieron controles para las variables que no superaron las comprobaciones de equilibrio, pero el diseño sigue teniendo muchas menos unidades de asignación independientes que el número de estudiantes que sugiere el titular. Entre los participantes con acceso a GPT, el 90,5 % declaró haber cumplido el tratamiento asignado.

El relato de OpenAI y el informe de Bocconi identifican la universidad como Bocconi. El artículo la llama una universidad europea líder y oculta tanto su nombre como el número de registro del ensayo de la American Economic Association para preservar el anonimato. El apéndice incluye más adelante el texto de la tarea específica de Bocconi. Es una laguna de documentación y reproducibilidad, no evidencia de un lugar de ensayo diferente.

La ganancia de 0,862 puntos pertenece a una sola rúbrica

El acceso a ChatGPT aumentó en 0,862 puntos la puntuación estimada de conocimiento y uso frente a una puntuación de control estimada de 2,09. En una escala de cinco puntos, es un efecto sustancial para la tarea probada. Las recomendaciones asistidas por ChatGPT también se acercaron más a los tres textos de los expertos.

El análisis estadístico del artículo atribuye parte de la ganancia a un mayor número de ideas, una lógica más clara y otras características textuales. Aproximadamente un tercio del efecto se mantuvo después de aplicar su conjunto más completo de controles de texto. Los investigadores interpretan ese resto como una mejora en la sustancia de las recomendaciones, no solo en su presentación.

El hallazgo sigue teniendo un límite claro: aquí «sustancia» significa una recomendación más sólida según la evaluación de conocimiento y uso empleada en el experimento. El ensayo no probó la recuperación de datos, el conocimiento empresarial duradero, el razonamiento independiente después de retirar ChatGPT ni el rendimiento ante un tipo de problema nuevo. Una puntuación mayor en un trabajo no puede sostener esas afirmaciones.

La intervención también utilizó GPT-4o a través de ChatGPT Edu. Los resultados de un modelo, entorno de cuenta, curso y tarea no deberían trasladarse a un modelo más reciente u otra disciplina sin realizar otra prueba.

La originalidad era una distancia calculada, no una nota de creatividad

El ejercicio de razonamiento causal enseñó a los estudiantes a construir cadenas de causa y efecto, formular condiciones que pudieran falsar una propuesta e identificar los mecanismos que harían que funcionara. Los estudiantes que lo recibieron utilizaron un razonamiento más basado en mecanismos y falsable. Sus ideas también fueron más diversas dentro de cada respuesta y más distintas de las de otros estudiantes.

La rúbrica de marketing estándar no recompensó esos cambios. En los modelos del artículo, las respuestas más alejadas del espacio de soluciones típico podían recibir puntuaciones más bajas. Esto explica por qué la formación podía cambiar el razonamiento y el conjunto de ideas sin mejorar la nota principal del trabajo.

«Originalidad» necesita su propia salvedad. Los evaluadores humanos no puntuaron directamente el mérito creativo. El apéndice describe un flujo computacional de varias etapas:

  1. GPT-5.2 extrajo repetidamente ideas candidatas con tres variantes de prompt.
  2. Se reconciliaron las ejecuciones repetidas, y GPT-5.2 y Claude Opus 4.6 juzgaron las coincidencias inciertas.
  3. Las ideas confirmadas se incorporaron mediante el modelo text-embedding-3-large de OpenAI.
  4. La distancia coseno midió cuánto se alejaban las ideas entre sí dentro de cada entrega y entre entregas.

Es una medida operativa de diversidad semántica, declarada y bastante elaborada. Puede detectar diferencias en el texto, pero no establece que una idea sea útil, viable, sorprendente para un experto del área o realmente nueva fuera de esta clase. Como los modelos de OpenAI participan en la extracción, el juicio y el flujo de embeddings, una réplica independiente también debería comprobar si el resultado sobrevive con modelos distintos y valoraciones humanas de originalidad.

¿Demostró el experimento que los estudiantes aprendieron más?

No. Mostró que el acceso a ChatGPT mejoró una recomendación terminada según una rúbrica concreta, mientras que la formación en razonamiento causal mejoró otras propiedades medidas de esa recomendación.

El aprendizaje requiere otra observación después de que termine la asistencia. Por ejemplo, un evaluador podría pedir a los estudiantes que expliquen su modelo causal, critiquen una propuesta desconocida, reproduzcan el razonamiento tras un intervalo o resuelvan un problema estructuralmente distinto sin ChatGPT. El experimento de Bocconi no hizo nada de eso.

Esa etapa ausente importa porque el rendimiento asistido y el aprendizaje pueden moverse en direcciones diferentes. En un experimento de campo independiente y revisado por pares sobre matemáticas de secundaria, los investigadores descubrieron que el acceso a GPT-4 mejoraba el rendimiento de práctica, pero que los estudiantes que usaban un asistente sin restricciones obtenían después un 17 % menos que el grupo de control en un examen sin asistencia. Un tutor diseñado para dar pistas en vez de respuestas mitigó en gran medida esa pérdida. El artículo de PNAS probó un grupo de edad, una asignatura, un diseño de herramienta y un resultado distintos, así que no es una réplica ni una refutación. Demuestra por qué un artefacto asistido no puede sustituir una medida posterior del aprendizaje.

El nuevo estudio es actualmente un working paper distribuido a través de los canales de OpenAI. El análisis de fuentes del 28 de agosto no encontró una publicación revisada por pares ni una réplica independiente. Una reconstrucción independiente de Next AI Press llegó a la misma advertencia principal de alcance: el resultado se refiere a una sola tarea y a medidas computacionales, no al aprendizaje a lo largo de un curso.

OpenAI también participó en la investigación. La lista de autores incluye investigadores actuales de OpenAI, un colaborador que trabajó en el proyecto mientras estaba empleado allí y un contratista remunerado de OpenAI. Esas afiliaciones no invalidan el experimento, pero hacen especialmente valiosas una réplica independiente y un registro público de preregistro.

El resultado más importante del estudio es la medida de aprendizaje que falta

El ensayo separó suficientemente la calidad de la respuesta, el razonamiento causal y una medida computacional de originalidad para mostrar que los tratamientos los movían de manera distinta. No observó qué podían retener o transferir los estudiantes después de retirar ChatGPT.

Esa ausencia no invalida la ganancia de 0,862 puntos en la respuesta comunicada. Limita la afirmación a un artefacto asistido producido bajo una sola rúbrica. Una tarea posterior, desconocida y sin asistencia respondería a una pregunta diferente y más importante desde el punto de vista educativo.

Por tanto, el estudio respalda una conclusión moderada: ChatGPT ayudó a los estudiantes a producir recomendaciones más sólidas en este contexto, mientras que la intervención de razonamiento causal cambió aspectos del trabajo que la rúbrica principal no recompensaba. No demuestra que ninguno de los dos grupos se convirtiera en mejores pensadores independientes.

Fuentes

  1. Training novices to think, or giving them LLMs? Evidence from an RCT
  2. OpenAI: Better answers, broader thinking
  3. Bocconi University: Better evaluations with ChatGPT
  4. Next AI Press reconstruction of the ChatGPT student study
  5. PNAS: Generative AI without guardrails can harm learning