La aparición de GPT-5 ha acaparado la atención del mundo tecnológico, con su lanzamiento generando grandes expectativas. Sin embargo, una serie de pruebas realizadas para evaluar su capacidad de programación han revelado resultados decepcionantes, al menos en comparación con versiones anteriores de este modelo de inteligencia artificial desarrollado por OpenAI.
GPT-5, que se presentó con gran fanfarria, no logró superar la mitad de las pruebas de programación elaboradas por un experto en el campo, lo que representa el peor desempeño registrado por un modelo de lenguaje de OpenAI hasta la fecha. Esta noticia ha sorprendido a muchos, dado que las versiones previas, como GPT-3.5 y GPT-4, habían establecido un estándar alto en cuanto a generación de código y resolución de problemas de programación.
El primer desafío para GPT-5 fue la creación de un plugin para WordPress, una prueba que sus predecesores habían superado sin problemas. Aunque el modelo generó un bloque de código que proporcionó una interfaz de usuario adecuada, falló en su función principal al redirigir incorrectamente al usuario a otra página web en lugar de producir los resultados esperados. Tras un nuevo intento, el modelo logró corregir el error, pero la necesidad de realizar múltiples intentos para obtener un resultado funcional fue vista como un retroceso significativo.
En un segundo test, que consistía en reescribir una función de cadena para manejar correctamente valores monetarios con decimales, GPT-5 cumplió con lo solicitado. Sin embargo, no realizó comprobaciones de errores adicionales, lo que evidenció una falta de atención al detalle que podría resultar problemática en aplicaciones más complejas.
La tercera prueba ponía a prueba la capacidad del modelo para identificar y solucionar un error en el código relacionado con el marco de trabajo de WordPress. En este caso, GPT-5 logró entender el problema y ofrecer una solución clara, demostrando que aún conserva algunas de las capacidades avanzadas de sus versiones anteriores.
El último desafío involucró la escritura de un script que integrara diversas herramientas de scripting de Mac, un reto que ha sido históricamente difícil para los modelos de inteligencia artificial. Aunque GPT-5 manejó adecuadamente una parte del problema, falló en entender completamente cómo se maneja la sensibilidad a las mayúsculas en AppleScript, lo que resultó en un código incorrecto.
La decisión de OpenAI de reemplazar completamente GPT-4o con GPT-5 sin opción de regresar a la versión anterior provocó una reacción negativa significativa entre los usuarios, lo que llevó a la compañía a restablecer la disponibilidad del modelo anterior. Esta situación refleja la importancia de las expectativas del usuario y la necesidad de garantizar que los nuevos lanzamientos cumplan con los estándares anteriores.
Aunque estos resultados iniciales son desalentadores, es importante considerar que GPT-5 aún está en sus primeras etapas de implementación y es probable que mejore con el tiempo a medida que se realicen ajustes y se recopile más retroalimentación de los usuarios. Por ahora, muchos desarrolladores han optado por seguir utilizando GPT-4o para sus tareas de programación, valorando su fiabilidad probada.
El futuro de GPT-5 dependerá de su capacidad para superar estos desafíos iniciales y demostrar su potencial en el mundo real. Mientras tanto, la comunidad tecnológica seguirá observando de cerca su evolución y el impacto que tendrá en el desarrollo de software y otras aplicaciones de inteligencia artificial.