OpenAI prueba modelos contra especialistas de 44 profesiones

OpenAI presentó nuevo benchmark GDPval, que prueba rendimiento de sus modelos de IA comparados con profesionales de varias industrias. Y es intento de entender qué tan cerca están sistemas de OpenAI de superar a humanos en trabajo económicamente significativo.

El benchmark se basa en 9 industrias que hacen mayor contribución al producto interno bruto de EE.UU. GDPval prueba rendimiento de modelos de IA en 44 profesiones en estas industrias, desde programadores hasta enfermeras y periodistas. Profesionales experimentados compararon informes generados por IA con trabajos de otros especialistas.

GPT-5 high fue calificado mejor o igual a expertos de industria en 46.6% de casos. Claude Opus 4.1 de Anthropic fue calificado mejor o igual a expertos de industria en 49% de tareas. Aunque OpenAI afirma que Claude mostró resultados tan altos debido a tendencia a crear gráficos atractivos.

Pienso que tales puntuaciones altas de modelos podrían estar infladas debido a limitaciones de pruebas. Y no reflejan rendimiento real. El nuevo benchmark mismo podría crear falsas expectativas sobre capacidades de IA en condiciones de trabajo reales.