La IA todavía tiene dificultades para corregir ejercicios como lo haría un entrenador
Artículo

La IA todavía tiene dificultades para corregir ejercicios como lo haría un entrenador

Un nuevo estudio ha puesto a prueba la capacidad de los principales modelos de inteligencia artificial para detectar errores durante el ejercicio a partir de 2.219 vídeos de 30 ejercicios con el peso corporal y 5.512 evaluaciones. La investigación, desarrollada con la participación de expertos en ciencias del deporte y utilizando imágenes procedentes de diferentes bases de datos académicas, concluye que incluso los modelos de IA más avanzados continúan teniendo importantes dificultades para identificar errores de postura y movimiento y determinar cuándo se producen durante la ejecución.

Un nuevo banco de pruebas para evaluar a la IA en fitness
La creciente incorporación de inteligencia artificial al entrenamiento está abriendo posibilidades para automatizar la evaluación de ejercicios, proporcionar indicaciones al usuario y desarrollar sistemas de entrenamiento cada vez más personalizados. Sin embargo, reconocer qué ejercicio está realizando una persona no es lo mismo que determinar si lo está ejecutando correctamente.
Para medir esta diferencia, un equipo de investigadores ha desarrollado FitAQA, un nuevo benchmark específicamente diseñado para evaluar la capacidad de los grandes modelos multimodales de lenguaje para analizar la calidad de ejecución de ejercicios físicos.
El trabajo, publicado el 9 de agosto de 2026, busca comprobar hasta qué punto estos sistemas son capaces de interpretar detalles relacionados con la postura y la dinámica del movimiento y utilizar posteriormente esa información para determinar si la ejecución es correcta.
La base de datos reúne 2.219 vídeos. De ellos, 1.976 son clips cortos destinados a evaluar la percepción y el juicio sobre la ejecución, mientras que otros 243 son vídeos más largos utilizados para comprobar si los modelos pueden identificar el momento concreto en el que aparece un error.
Los clips cortos proceden de cuatro conjuntos de datos académicos: QEVD-FIT-300k, EgoExo-Fitness, Kinetics-700 y UCF101. Los vídeos largos proceden de diferentes conjuntos de QEVD vinculados al fitness. En total se incluyen 30 ejercicios habituales realizados con el peso corporal.

38 tipos de errores en seis áreas diferentes
Una de las particularidades del estudio es que no se limita a preguntar a la inteligencia artificial si un ejercicio está bien o mal ejecutado.
En colaboración con expertos en ciencias del deporte, los investigadores desarrollaron una clasificación común formada por 38 errores recurrentes de postura y movimiento, distribuidos en seis dimensiones: alineación, simetría, estabilidad, coordinación, ritmo y ejecución completa.
El objetivo era disponer de criterios aplicables a diferentes ejercicios y comprobar qué parte del proceso plantea mayores dificultades a la IA.
Para ello, FitAQA establece tres niveles de evaluación. El primero analiza la percepción, es decir, si el modelo es capaz de reconocer correctamente lo que está sucediendo en el vídeo. El segundo evalúa su capacidad para utilizar esa información y juzgar si el ejercicio está correctamente ejecutado. El tercero estudia si puede localizar temporalmente el error y determinar en qué momento concreto de un vídeo se produce.
La elaboración de los datos contó además con revisión humana. Los vídeos fueron anotados inicialmente y posteriormente revisados por expertos, que comprobaron que los errores identificados, las descripciones y los intervalos temporales fueran coherentes con la clasificación establecida y con lo que realmente podía observarse en las imágenes.

La percepción visual sigue siendo el principal problema
Los resultados muestran que los modelos actuales todavía encuentran dificultades importantes cuando tienen que evaluar la calidad del movimiento de forma detallada.
Los investigadores observaron que la precisión en las tareas de percepción se mantiene baja y que ninguno de los sistemas evaluados consigue un rendimiento sólido y consistente en las seis dimensiones analizadas.
Esto resulta especialmente relevante para cualquier aplicación destinada a proporcionar correcciones automáticas durante el entrenamiento. Un modelo puede reconocer que una persona está realizando determinado ejercicio y, sin embargo, no detectar correctamente las pequeñas desviaciones de postura, trayectoria o ritmo que diferencian una buena ejecución de una incorrecta.
El estudio identifica precisamente la percepción visual como uno de los principales cuellos de botella. Cuando los investigadores proporcionaron a los modelos la información perceptiva correcta sobre lo que estaba ocurriendo en el vídeo, su capacidad posterior para juzgar la ejecución mejoró sustancialmente.
Esto apunta a una diferencia importante: el problema no reside únicamente en que la IA desconozca cómo debería realizarse un ejercicio, sino en su capacidad para interpretar con suficiente precisión lo que está viendo.

Detectar cuándo se produce el error también plantea dificultades
La tercera prueba resulta especialmente interesante para futuras aplicaciones de entrenamiento automatizado: localizar exactamente en qué momento aparece un error.
En los 243 vídeos largos, los modelos tuvieron que identificar los intervalos temporales en los que se producían determinados fallos de ejecución. Los resultados empeoraron cuando se exigió mayor precisión para localizar esos momentos.
Los investigadores concluyen que los modelos multimodales actuales siguen teniendo una capacidad limitada para localizar con precisión en el tiempo los errores relacionados con la calidad del movimiento.
Esta limitación puede ser relevante a la hora de desarrollar herramientas capaces de proporcionar feedback en tiempo real, ya que no basta con reconocer que existe un error: para corregirlo de forma útil es necesario identificar qué está ocurriendo y cuándo sucede.

Una oportunidad para desarrollar herramientas más precisas
Los resultados no cuestionan el potencial de la inteligencia artificial aplicada al entrenamiento. Al contrario, FitAQA pretende proporcionar una herramienta que permita medir de forma sistemática sus avances y desarrollar modelos más fiables para este tipo de aplicaciones.
La investigación pone de manifiesto, sin embargo, la distancia que todavía existe entre las capacidades generales de comprensión de vídeo de los grandes modelos multimodales y la precisión necesaria para valorar aspectos técnicos de la ejecución de un ejercicio.
Para gimnasios y profesionales del entrenamiento, esta diferencia resulta especialmente significativa. Las soluciones basadas en IA pueden convertirse en herramientas de apoyo cada vez más potentes, pero la evaluación técnica del movimiento exige interpretar detalles de postura, estabilidad, coordinación y rango de movimiento que los sistemas actuales todavía no identifican de forma suficientemente consistente.
FitAQA ofrece ahora un marco específico para medir esa evolución. Sus autores prevén además hacer públicos tanto el conjunto de datos como el código de evaluación, facilitando que nuevos modelos puedan someterse a las mismas pruebas.

Conclusión
La inteligencia artificial avanza rápidamente en el sector del fitness, pero el nuevo estudio muestra que reconocer un ejercicio y comprender realmente cómo se está ejecutando siguen siendo capacidades diferentes.
Los resultados de FitAQA sitúan la percepción visual y la localización precisa de los errores entre los principales retos pendientes. Para los profesionales del fitness, el estudio aporta además una referencia interesante sobre el estado actual de estas tecnologías: la IA puede convertirse en un importante apoyo para el entrenamiento, pero la corrección técnica precisa del movimiento continúa siendo un terreno en el que todavía existe margen considerable de mejora.

La IA todavía tiene dificultades para corregir ejercicios como lo haría un entrenador
Subir