Resumen ejecutivo

Los experimentos publicados por universidades y organismos internacionales entre 2024 y 2026 arrojan resultados que van desde el equivalente a un mes extra de clase hasta ganancias que colocan al alumno promedio por delante de nueve de cada diez compañeros, y un caso documentado de daño. Lo que separa un extremo del otro no es el modelo de lenguaje, sino tres decisiones institucionales: si la herramienta está diseñada para guiar o para responder, si el docente está dentro del circuito, y si alguien mide aprendizaje en lugar de adopción. Para una institución mexicana o latinoamericana, «¿permitimos la IA?» es la pregunta equivocada; la correcta es «¿con qué diseño y con qué medición?».

Un problema de hace cuarenta años

En 1984, Benjamin Bloom publicó en Educational Researcher un hallazgo que lleva cuatro décadas incomodando a quienes nos dedicamos a la educación y a la tecnología. Comparó alumnos que recibían clase normal en el aula contra alumnos con clases particulares, uno a uno, y la distancia resultó enorme: si ponemos en fila a cien estudiantes del grupo convencional, el alumno promedio del grupo con tutor queda por delante de noventa y ocho de ellos. Bloom lo formuló no como una celebración sino como un desafío: sabemos qué funciona y ningún sistema educativo del mundo puede pagar un maestro por alumno. Esa frontera se mantuvo intacta cuarenta años. Lo que ha cambiado en los últimos tres es que, por primera vez, hay experimentos de verdad —alumnos repartidos al azar entre un método y otro, no encuestas de satisfacción— que miden qué ocurre cuando quien hace de tutor es una inteligencia artificial. Usaré en todo el artículo esa misma vara, la de Bloom: a cuántos compañeros, de cada cien, deja atrás el alumno promedio.

La evidencia que sí existe

El estudio más contundente lo publicó en junio de 2025 el Departamento de Física de Harvard en Scientific Reports. Kestin, Miller y sus colegas montaron un experimento muy bien armado: los mismos 194 estudiantes recibieron, en semanas consecutivas, una lección con un tutor basado en un modelo de lenguaje y otra con aprendizaje activo en el aula, con contenido idéntico y el orden invertido entre grupos, de modo que cada alumno fue su propio punto de comparación. El resultado: el alumno promedio del grupo con tutor de IA terminó por delante de 74 de cada 100 compañeros del grupo presencial, y hasta de 90 de cada 100 si se corrige el hecho de que muchos tocaron el techo de la prueba y no se pudo medir cuánto más sabían. Y lo logró en menos de una hora: la mitad de esos alumnos terminó en 49 minutos o menos, contra los 60 que duró la clase. Conviene ponerlo en perspectiva: el estudio del National Bureau of Economic Research que agrupa 96 experimentos de tutoría humana sitúa a un tutor de carne y hueso en 64 de cada 100.

La evidencia no se limita a una universidad de élite. El Banco Mundial repartió al azar a los alumnos de nueve escuelas de Benín City, Nigeria, entre los que entraban y los que no a un programa extraescolar donde trabajaron seis semanas con un asistente generativo guiado por un docente. Los que entraron quedaron por delante de 62 de cada 100 de los que no, una ganancia que los autores traducen en el equivalente a dos años de escolaridad. En Ghana, un tutor de matemáticas que funciona por WhatsApp alcanzó con cerca de mil alumnos, en ocho meses, exactamente el mismo tamaño que un tutor humano.

En nuestra región la evidencia es más escasa, pero existe y es buena. El experimento de Letrus —una plataforma brasileña que corrige con inteligencia artificial las redacciones de los alumnos y les devuelve comentarios en minutos— se hizo en el estado de Espírito Santo, en Brasil, con 178 escuelas públicas y unos 19,000 estudiantes de último año: subió la calificación de redacción del ENEM, el examen nacional de ingreso a la universidad, el equivalente a un mes extra de clase y, sobre todo, hizo que escribieran entre 29 y 32% más borradores. El gobierno del estado lo metió al presupuesto educativo y lo ha extendido a más de 100,000 alumnos. En Polonia, un experimento en 548 escuelas midió esa misma ganancia de un mes. Y en Uruguay, la evaluación de la Plataforma Adaptativa de Matemática de Ceibal —una comparación de alumnos reales a lo largo de tres años, no un experimento con grupos formados al azar— dejó al alumno promedio por delante de 58 de cada 100, y por delante de 66 de cada 100 entre los de menor nivel socioeconómico. Donde más falta hacía, más sirvió.

Hay además dos beneficios bien medidos que casi nadie discute. La Education Endowment Foundation británica probó con 259 docentes de ciencias de 68 escuelas un asistente para preparar clases: la planeación semanal bajó de 81.5 a 56.2 minutos, 31% menos, y un panel de expertos que no sabía qué material venía de dónde no encontró diferencia de calidad. Y en el experimento de Stanford llamado Tutor CoPilot, donde la IA no sustituye al tutor sino que le sugiere jugadas pedagógicas mientras enseña, cuatro alumnos más de cada cien dominaron el tema de la sesión, y nueve más de cada cien cuando el tutor era de los peor calificados, todo a veinte dólares por tutor al año. Es el hallazgo que más me interesa de toda esta literatura: la IA rindió más precisamente donde el sistema es más débil.

Lo que separa el éxito del fracaso

Conviene decir lo que la evidencia muestra en contra, porque es justamente lo que explica el resto. En el experimento que Bastani y sus colegas de Wharton publicaron en PNAS en junio de 2025, con cerca de mil alumnos de secundaria en Turquía, el grupo que usó una interfaz generativa sin restricciones resolvió 48% mejor los ejercicios mientras tenía la herramienta delante y después, en el examen sin ayuda, rindió 17% peor que el grupo que nunca la tuvo. El mismo experimento tenía un tercer grupo, con un tutor configurado por los docentes para dar pistas y nunca la solución: con él los alumnos practicaron 127% mejor y el daño desapareció. Un solo experimento, dos resultados opuestos, el mismo modelo debajo. La diferencia estaba en el diseño.

El segundo factor es el uso real. El experimento de Oreopoulos y Low con Khanmigo en dieciocho escuelas de Tennessee, el más largo que existe, encontró en dos años una ganancia tan pequeña que apenas mueve dos lugares al alumno promedio en una fila de cien, y la razón está en sus propias cifras: la mitad de los alumnos escribió al tutor en menos de un tercio de los días en que practicó. Dar acceso no es desplegar.

Quiénes lo están haciendo como política pública

Estonia es el experimento nacional más ambicioso. Su programa TI-Hüpe arrancó en 2025 con 154 de los 156 liceos del país, unos veinte mil alumnos y cerca de 4,700 docentes, y con una condición que lo distingue de casi todo lo demás: la Universidad de Tartu evalúa de forma independiente a más de nueve mil alumnos, con mediciones previas y posteriores. El resumen de su primer año trae un dato que ningún proveedor publica: de las conversaciones registradas, 51.1% fueron de uso orientado a aprender y solo 6.9% de alumnos buscando la respuesta hecha. Sus docentes reportan 1.8 horas de ahorro semanal y, a la vez, que 73% ha visto trabajos buenos que el alumno no sabe explicar. Las dos cosas, sin maquillar.

Europa añade la vía normativa: el Reglamento de IA clasifica como de alto riesgo calificar aprendizajes y decidir admisiones, y obliga desde febrero de 2025 a enseñar a usar la IA; Eurostat registra que 41% de los jóvenes europeos ya la usa para sus estudios. En Estados Unidos, la encuesta de RAND de 2025 encontró que 54% de los alumnos la usa para tareas y que más del 80% dice que nadie en la escuela les enseñó a usarla.

Lo que esto significa para México

TALIS 2024 de la OCDE revela algo que contradice el estereotipo: los docentes latinoamericanos usan IA más que sus pares de los países ricos. Brasil 56%, Chile 55%, Colombia 53% y Costa Rica 52%, contra 36% del promedio de la OCDE; en formación recibida, Brasil llega a 68% y Chile a 64% frente a 38%. El profesorado de la región no está bloqueando la IA: la está usando. Lo que falta es lo demás: la barrera que más mencionan quienes no la usan es la infraestructura —76% en Colombia, 60% en Chile— y la UNESCO documentó que menos del 10% de las escuelas y universidades del mundo tiene una política formal de uso.

Para México el orden de los problemas es claro. Primero la base material: el dato más reciente de la UNESCO, de 2021, sitúa en 29.6% las escuelas primarias mexicanas con internet para fines pedagógicos. Segundo, el punto de partida: en PISA 2025 México obtuvo 388 puntos en matemáticas frente a los 463 del promedio de los países de la OCDE. Y tercero, la ausencia que más me preocupa: no existe en el país una sola evaluación de impacto publicada sobre herramientas de IA en educación, ni federal ni estatal. No es que midamos mal; es que no medimos.

De la evidencia internacional se desprenden cuatro decisiones que cualquier institución mexicana puede tomar sin esperar a nadie. Escribir la regla de uso por materia antes de comprar la licencia, distinguiendo con ejemplos qué es apoyo y qué es sustitución. Elegir herramientas configuradas para preguntar y no para responder, que es la diferencia entre los dos grupos del experimento de Wharton. Poner al docente dentro del circuito y no al margen, que es donde aparecen los efectos mayores y más equitativos. Y medir aprendizaje, no adopción: usuarios activos no es un indicador educativo, y quien no evalúe en sus propias aulas estará comprando promesas.

Bloom escribió que el reto de su generación era dar a cada alumno lo que la tutoría personal le daba, a un costo que una sociedad pudiera pagar. Cuarenta años después tenemos por primera vez una tecnología que, bien diseñada y bien acompañada, se acerca a esa cifra por veinte dólares al año; y tenemos también la evidencia de que, mal diseñada, hace lo contrario. Lo que decidirá cuál de las dos cosas ocurre en nuestras aulas no es la inteligencia artificial: somos nosotros.