Los nuevos modelos de OpenAI razonan más pero también “alucinan” más que nunca, y no saben por qué

La inteligencia artificial avanza a pasos agigantados, ya con razonamiento en los modelos, pero peor en lo que respecta a las alucinaciones, y es algo que preocupa a OpenAI.
Prácticamente todos los meses contamos con anuncios de nuevos modelos de inteligencia artificial que superan a los anteriores, los últimos ya incluso con funciones de razonamiento, pero estos avances están contando con un aspecto negativo que preocupa: las alucinaciones.
Las alucinaciones en inteligencia artificial son uno de los graves problemas a los que se están enfrentando las grandes empresas tecnológicas y es cuando alguno de estos modelos ofrece algún tipo de información o razonamiento que afirma con rotundidad, pero no es exacto o cierto.
Lo preocupante, es que los nuevos modelos de OpenAI, tanto el o3 como el 04-mini, generan más alucinaciones que nunca si los comparamos con modelos anteriores.
Según las pruebas internas de OpenAI, tanto o3 como o4-mini que cuentan con funciones de razonamiento, alucinan con más frecuencia que los modelos de razonamiento anteriores de la empresa, incluso frente a aquellos modelos tradicionales como el GPT-4o.
Pero lo preocupante del asunto, es que OpenAI no sabe exactamente por qué está sucediendo esto y, si continúan así las cosas, sus futuribles modelos podrían no ser precisamente muy confiables.
En el último informe técnico sobre o3 y o4-mini, OpenAI señala que necesita más investigación para comprender por qué las alucinaciones empeoran en la medida en que amplían los modelos de razonamiento.
Señalan, que o3 alucinó al responder el 33 % de las preguntas en PersonQA, un punto de referencia interno de la compañía para medir la precisión de un modelo sobre las personas.
Esto representa aproximadamente el doble de la tasa de alucinaciones de los modelos de razonamiento anteriores.
Por otra parte 04-mini obtuvo incluso un resultado peor en PersonQA con alucinaciones el 48 % del tiempo.
Igualmente pruebas externas como las que hizo Transluce, un laboratorio de investigación de inteligencia artificial sin fines de lucro, también desveló evidencia de que estos nuevos modelos tienden a inventar más que nunca: “Nuestra hipótesis es que el tipo de aprendizaje de refuerzo utilizado para los modelos de series ‘o’ puede amplificar problemas que normalmente se mitigan (pero no se eliminan por completo) mediante procesos de postentrenamiento estándar”, afirmó Neil Chowdhury, investigador de Transluce.
Si bien a veces estas alucinaciones pueden ayudar a los modelos a que sean más imaginativos y creativos, si se busca información clara, concisa y precisa, deberían tener una tasa de alucinación prácticamente inexistente.
Una forma de aumentar la precisión de los modelos es con las funciones de búsqueda web, pero a veces no todo lo que se encuentra en la web es exacto o fidedigno.
“Abordar las alucinaciones en todos nuestros modelos es un área de investigación continua, y trabajamos continuamente para mejorar su precisión y confiabilidad”, dijo a Techcrunch el portavoz de OpenAI, Niko Felix.