El test de Turing, formulado por el matemático británico Alan Turing en 1950, planteaba una pregunta sencilla: ¿puede una máquina conversar de forma indistinguible de un humano? Durante décadas fue la referencia teórica para hablar de inteligencia artificial, aunque nunca se aplicó de forma sistemática como herramienta de evaluación técnica. Con la llegada de los modelos de lenguaje conversacionales, esa pregunta ha dejado de tener sentido práctico, según sostienen los autores del artículo.
"La respuesta a la pregunta original de Turing [¿puede una máquina pasar por un humano?] ya se ha contestado, en afirmativo", afirma Hernández-Orallo en el texto publicado en Science. El investigador considera que la discusión sobre si una máquina puede pasar por humana ha quedado superada: los chatbots actuales mantienen conversaciones fluidas, resuelven problemas complejos y generan textos que en muchos contextos resultan indistinguibles de los escritos por personas.
El problema, según el equipo, no es que las máquinas hayan superado el listón de Turing, sino que la industria carece de herramientas fiables para comparar el rendimiento real de los distintos modelos. En los últimos años se ha impuesto un sistema de clasificaciones basado en la superación de pruebas estandarizadas, conocidas en inglés como benchmarks, que miden capacidades concretas: resolución de problemas matemáticos, comprensión de textos, generación de código o razonamiento lógico.
Hernández-Orallo cuestiona ese modelo. "La evaluación basada en hitos [benchmarks] convierte la IA en una carrera para maximizar indicadores", sostiene en el artículo. Esa dinámica, señalan los autores, empuja a las empresas desarrolladoras a optimizar sus modelos para sobresalir en pruebas específicas, sin que ello garantice un desempeño fiable en tareas cotidianas o en contextos distintos a los evaluados.
La preocupación no es nueva en otros campos del aprendizaje automático: los especialistas llevan años debatiendo el fenómeno del overfitting a los benchmarks, es decir, el ajuste artificial de un sistema para rendir bien en una prueba concreta sin que esa mejora se traduzca en una capacidad real y generalizable. El artículo de Science traslada esa inquietud al terreno de los grandes modelos de lenguaje, cuya opacidad interna dificulta aún más determinar qué han aprendido realmente.
Tres alternativas a la clasificación única
Frente a ese escenario, los autores proponen tres enfoques alternativos. Uno se inspira explícitamente en el etiquetado nutricional de los alimentos: en lugar de un ranking único que ordene los modelos de mejor a peor, plantean fichas descriptivas que detallen capacidades, limitaciones y riesgos de cada sistema en distintas categorías, de forma que el usuario pueda elegir la herramienta adecuada según el uso previsto. Los otros dos se centran en evaluar la capacidad de adaptación de los modelos ante tareas nuevas no vistas durante su entrenamiento y en medir su fiabilidad y consistencia a lo largo de interacciones prolongadas, un aspecto especialmente relevante para aplicaciones profesionales donde el error acumulado puede tener consecuencias prácticas.
Ese planteamiento descentralizado busca romper con la lógica de la competición por el primer puesto, que ha dominado el sector desde la irrupción de los grandes modelos de lenguaje. La aparición del modelo chino Kimi K3, que a mediados de julio generó un notable revuelo en Silicon Valley, evidenció que la carrera por la supremacía en inteligencia artificial ya no es exclusiva de las empresas estadounidenses, lo que ha intensificado la presión por métricas comparativas cada vez más sofisticadas.
El debate sobre cómo medir la inteligencia artificial tiene implicaciones que exceden el ámbito académico. Empresas, gobiernos y organismos reguladores necesitan criterios objetivos para decidir qué sistemas emplear en sectores sensibles como la sanidad, la justicia o la educación. La Unión Europea, a través del Reglamento de Inteligencia Artificial aprobado en 2024, exige a los desarrolladores de sistemas de alto riesgo que documenten de forma transparente sus capacidades y limitaciones, un enfoque que guarda paralelismos con la filosofía de la etiqueta nutricional que plantean los científicos.
El propio origen del test de Turing ilustra hasta qué punto la referencia se ha vuelto obsoleta. Concursos como el Premio Loebner, celebrado anualmente desde 1991 para premiar al programa que mejor imitase una conversación humana, se apoyaban en variantes del test de Turing y fueron perdiendo relevancia a medida que los sistemas conversacionales avanzaban. La irrupción de los modelos generativos de gran escala terminó de desplazar ese marco hacia las pruebas de rendimiento cuantitativas que hoy dominan el sector.
El artículo no ofrece una solución cerrada, sino que plantea los tres enfoques como líneas de investigación complementarias que la comunidad científica y la industria deberían desarrollar en los próximos años. Sus autores reconocen que ninguno de los métodos propuestos sustituye por completo a los benchmarks actuales, pero insisten en la necesidad de combinar distintas perspectivas para evitar que la evaluación de la inteligencia artificial se reduzca a una carrera de cifras.
El impacto de la propuesta dependerá en gran medida de su adopción por parte de las principales empresas del sector, entre ellas OpenAI, Google DeepMind, Anthropic o las compañías chinas que compiten por el liderazgo tecnológico global. De momento, el debate queda abierto en el ámbito científico, sin que consten compromisos concretos por parte de la industria para modificar sus actuales sistemas de evaluación y comparación de modelos.

