
Introducción
Las herramientas de IA generativa como ChatGPT son cada vez más utilizadas por atletas, entrenadores y personal de apoyo como una fuente rápida de consejos sobre salud y rendimiento. Pero ¿qué tan confiable es ese consejo cuando se trata del complejo dominio basado en evidencia de la ciencia del sueño y el manejo del desfase horario en el deporte de élite? Un nuevo estudio publicado en Sports Medicine puso a prueba GPT-4, utilizando un proceso estructurado de consenso Delphi para que expertos internacionales en sueño evaluaran y refinaran las respuestas generadas por IA sobre 20 temas clave. El resultado es un veredicto mixto: GPT-4 ofrece un punto de partida útil, pero aún no está listo para servir por sí solo como guía autorizada para atletas.
El estudio, dirigido por Jacopo Vitale y un equipo que incluye a Alan McCall, Shona Halson y Dina C Janse van Rensburg, se realizó bajo los auspicios del Athlete Travel & Sleep Interest Group (ATSIG). Es uno de los primeros intentos sistemáticos de comparar el resultado de modelos de lenguaje grandes con el consenso de expertos en la literatura de medicina deportiva.
Lo que encontraron
El equipo de investigación generó un conjunto de respuestas estilo FAQ sobre sueño y desfase horario usando GPT-4, cubriendo 20 temas que reflejan preguntas comunes que atletas y profesionales hacen. Estos temas abarcaron desde la fisiología básica del sueño y los ritmos circadianos hasta estrategias prácticas para manejar el desfase horario, las siestas, la higiene del sueño y la recuperación. El contenido generado por IA se presentó luego a 17 expertos internacionales en ciencia del sueño y ritmos circadianos, quienes evaluaron cada tema por su precisión, integridad y adecuación para una población atlética.
La evaluación siguió un método Delphi de dos rondas, una técnica bien establecida para construir consenso entre expertos a través de retroalimentación iterativa y anónima. Después de la Ronda 1, 15 de los 20 temas (75%) habían alcanzado un umbral de consenso predefinido. Tras incorporar la retroalimentación de los expertos y revisar el contenido, la Ronda 2 elevó ese número a 18 de 20 temas (90%), lo que indica un fuerte acuerdo general entre el panel.
Dos temas no lograron alcanzar consenso en ninguna de las dos rondas. El primero fue la relación entre el sueño y el riesgo de lesión, que recibió solo un 64,7% de acuerdo. El segundo fue la orientación sobre melatonina y otros ayudas para dormir. Estos temas son inherentemente polémicos en la medicina deportiva, donde la base de evidencia aún está evolucionando y las opiniones de los expertos divergen sobre las recomendaciones apropiadas.
Más allá de los datos de consenso, el estudio catalogó las preocupaciones de los expertos sobre las respuestas originales de GPT-4. Estas preocupaciones se dividieron en varias categorías. La más prominente fue que el contenido era impreciso o engañoso: el 55% de los expertos plantearon esta preocupación para los temas relacionados con el sueño, y el 34% lo hizo para los temas de desfase horario. Una falta de contextualización específica para atletas fue señalada por el 30% del panel. Además, los expertos notaron que parte del contenido se basaba en evidencia desactualizada, con tasas que oscilaban entre el 11% y el 36% según el tema.
Por qué es importante
Los atletas de élite operan en un entorno donde pequeños márgenes separan el éxito del fracaso. La calidad del sueño y la alineación circadiana son reconocidas como factores críticos en la recuperación, la función cognitiva, la prevención de lesiones y el rendimiento competitivo. Sin embargo, el acceso a una guía confiable y específica para atletas sobre el sueño sigue siendo desigual, particularmente para los atletas que viajan y enfrentan cambios frecuentes de huso horario. Las herramientas de IA generativa prometen democratizar el acceso al conocimiento de nivel experto, pero sus resultados solo son tan buenos como los datos con los que fueron entrenados y la validación que reciben.
Este estudio es importante porque proporciona un método concreto y reproducible para cerrar la brecha entre la información generada por IA y la guía respaldada por expertos. En lugar de tratar el resultado de GPT-4 como un producto terminado, los investigadores lo utilizaron como material preliminar que podía refinarse mediante una revisión estructurada por expertos. El proceso Delphi identificó debilidades específicas en el contenido de IA y las mejoró sistemáticamente. El resultado es un conjunto de 18 respuestas de FAQ respaldadas por expertos que tienen significativamente más autoridad que el resultado bruto de GPT-4 por sí solo.
Los hallazgos también tienen implicaciones más allá de la medicina deportiva. El mismo patrón probablemente se aplica en otros dominios especializados donde la precisión, la actualidad y el matiz contextual importan: guías clínicas, consejos nutricionales, programación de entrenamiento y protocolos de rehabilitación. La IA puede acelerar el proceso de redacción, pero la experiencia humana sigue siendo esencial para verificar y refinar los resultados.
Para los profesionales, el estudio refuerza una precaución práctica: no tomar los consejos de salud y rendimiento generados por IA al pie de la letra. La tasa del 55% de preocupación de los expertos sobre la imprecisión en el contenido del sueño, combinada con la falta de consenso sobre la melatonina y el riesgo de lesión, muestra que GPT-4 puede producir respuestas que suenan autorizadas pero no son suficientemente precisas o completas para su aplicación en el mundo real con atletas.
Límites
El estudio tiene varias limitaciones que vale la pena señalar. La muestra de 17 expertos, aunque diversa e internacionalmente reconocida, es relativamente pequeña. Un panel más grande podría haber producido diferentes umbrales de consenso o haber descubierto preocupaciones adicionales. El método Delphi en sí mismo, aunque riguroso, requiere mucho tiempo y depende de la calidad de los materiales iniciales y el compromiso de los participantes. El resultado de GPT-4 utilizado en el estudio refleja una instantánea específica de las capacidades del modelo; dado que los modelos de lenguaje grandes se actualizan con frecuencia, los resultados pueden no generalizarse a versiones más nuevas o a otros sistemas de IA.
El alcance de los temas de FAQ también se limitó a 20 tópicos seleccionados por el equipo de investigación. Hay muchas preguntas adicionales que los atletas podrían hacer sobre el sueño y el desfase horario que no fueron incluidas, y el estudio no evalúa qué tan bien funcionan las respuestas refinadas por expertos en el mundo real ni si mejoran los resultados de los atletas. Finalmente, el estudio no comparó el resultado de GPT-4 con el de otros modelos de IA, por lo que no está claro si los sistemas alternativos funcionarían mejor o peor.
Conclusión
El contenido generado por GPT-4 sobre sueño y desfase horario para atletas puede servir como material preliminar útil, pero requiere refinamiento por parte de expertos antes de ser adecuado como guía. El proceso de consenso Delphi mejoró el acuerdo del 75% al 90%, y los 18 temas respaldados por expertos resultantes representan un paso significativo hacia una guía confiable asistida por IA en medicina deportiva. Sin embargo, dos temas importantes (sueño y riesgo de lesión, melatonina y ayudas para dormir) no pudieron alcanzar consenso incluso después de dos rondas, lo que subraya que algunas áreas siguen siendo demasiado polémicas o con evidencia insuficiente para que una sola fuente las resuelva. Los atletas, entrenadores y profesionales deben tratar los consejos de sueño generados por IA como un borrador, no como una respuesta final, y buscar verificación experta para decisiones de alto riesgo.
Fuente
Vitale J, McCall A, Halson S, Janse van Rensburg DC, et al. From GPT-4 to Expert-Endorsed Athlete Guidance: A Delphi Consensus on Sleep and Jet Lag. Sports Medicine. 2026. DOI: 10.1007/s40279-026-02484-7. PMID: 42470603.
Traducido por Alessandra

