
Los modelos de lenguaje extenso pueden producir planes de proyectos científicos de calidad comparable a los escritos por investigadores humanos, pero los evaluadores basados en IA muestran una preferencia sistemática por las propuestas generadas por IA, según un nuevo estudio publicado en arXiv.
El estudio, dirigido por Jia Liu del Instituto Kavli para la Física y las Matemáticas del Universo, comparó propuestas de investigación de una página escritas por humanos y por tres LLM (ChatGPT 4o, Claude Sonnet 4 y DeepSeek V3) en ocho proyectos concebidos por expertos en física, astrofísica y cosmología.
Ocho expertos en dominio esbozaron cada uno un proyecto de investigación que cubría temas como la evolución de los núcleos galácticos activos, la conexión galaxia-halo de materia oscura, los alineamientos intrínsecos por lentes débiles, las binarias de agujeros negros por ondas gravitacionales y las pruebas de la relatividad general con matrices de temporización de púlsares. Planificadores de proyectos humanos, estudiantes de posgrado o posdoctorados expertos en cada tema, escribieron entonces una propuesta cada uno sin asistencia de IA. Por separado, estudiantes de pregrado fuera de los campos específicos utilizaron una plantilla de indicación fija para generar tres propuestas de IA por proyecto, produciendo un corpus total de 32 propuestas: ocho escritas por humanos y 24 generadas por IA.
Cuatro investigadores senior actuaron como revisores humanos ciegos, evaluando las propuestas en cuanto a claridad, idoneidad de los métodos, planificación de recursos y viabilidad. Dos LLM de frontera, Claude Opus 4.8 y ChatGPT Pro 5.5, realizaron la misma evaluación.
Los revisores humanos calificaron las propuestas humanas y generadas por IA de manera similar en general, con una puntuación media de aproximadamente 3.5 sobre 5 para ambos grupos. Sin embargo, los revisores de IA puntuaron las propuestas generadas por IA aproximadamente un punto más que las escritas por humanos, revelando un sesgo sistemático pro-IA. Este sesgo se concentró en los proyectos donde los planes humanos eran más débiles; la correlación entre la calidad del plan humano y el sesgo del revisor de IA fue de aproximadamente -0.95.
Cuando se les pidió identificar si cada propuesta fue escrita por humanos o por IA, los revisores humanos alcanzaron un 72 por ciento de precisión para las propuestas humanas y un 79 por ciento para las generadas por IA, con una precisión individual que osciló entre el 59 y el 88 por ciento. Los revisores humanos identificaron las propuestas generadas por IA por características como secciones de metodología de cinco pasos similares a plantillas, ausencia de citas, plazos en números redondos y uso excesivo de terminología de aprendizaje automático. Las propuestas escritas por humanos se distinguían por citas específicas autor-año, jerga de dominio idiosincrática, redacción en primera persona y alcance enfocado.
Ambos revisores de IA clasificaron correctamente las 32 propuestas con un 100 por ciento de precisión, aplicando las mismas pistas de manera consistente y sin errores, citando características como plantillas uniformes de cinco fases, prosa impersonal pulida, opciones de encuesta genéricas, listas exhaustivas de herramientas y mitigación de riesgos estándar.
El artículo señala que los resultados sugieren cautela al implementar LLMs ampliamente en la preparación y evaluación de propuestas, ya que los evaluadores de IA podrían introducir un sesgo sistemático a favor del contenido generado por IA.
Imágenes: (ninguna, artículo de investigación)
Fuentes: arXiv:2607.25881 (Liu et al., 28 jul. 2026)
Traducido por Alessandra

