16/06/2023
Peter Wason Vs ChatGPT
Hace unos días, escribí sobre la importancia de enseñar matemáticas debido a su vínculo con diferentes herramientas de pensamiento. En mi último libro de matemáticas, incluí un prefacio en el que hablo sobre una prueba inventada por Peter Wason en el siglo pasado que parece mostrar un sesgo o error en nuestra capacidad de razonamiento.
La prueba, conocida como la tarea 2-4-6, presenta a los participantes una secuencia de números: 2-4-6. La tarea consiste en deducir la regla subyacente a la secuencia proponiendo nuevas secuencias de tres números. El experimentador informa si la secuencia propuesta sigue o no la regla. El objetivo es determinar cuál es la regla que siguen los números.
Cuando las personas se enfrentan al problema 2-4-6, suelen caer en lo que se conoce como sesgo de confirmación. Tienden a proponer secuencias que confirman sus hipótesis en lugar de ponerlas a prueba. Por ejemplo, pueden proponer 8-10-12 o 1-3-5, suponiendo que la regla es “aumentar de dos en dos”. Cuando el experimentador confirma que estas secuencias siguen la regla, los participantes pueden concluir falsamente que conocen la regla sin darse cuenta de que no es la única solución.
Para evitar el sesgo de confirmación, es importante poner a prueba nuestras hipótesis con secuencias que no cumplan con ellas. Por ejemplo, si nuestra hipótesis es que la regla es “aumentar de dos en dos”, podríamos probar con secuencias como 1-2-3 o 6-4-2. Este tipo de razonamiento se utiliza comúnmente en el trabajo científico.
Recientemente, decidí poner a prueba la capacidad del ChatGPT de OpenAI con el problema de Wason utilizando Bing de Microsoft, que funciona con ChatGPT-4. Comprendió inmediatamente lo que debía hacer y comenzó a proponer diferentes secuencias de números sin revelar su hipótesis. Después de tres intentos, me presentó su hipótesis: era incorrecta y mostraba un sesgo de confirmación. Le pedí que investigara qué es el sesgo de confirmación y que lo evitara al proponer nuevas secuencias. Continuó confirmando sus hipótesis y nunca pudo evitarlo.
Unos días después, repetí el experimento directamente en la página de OpenAI con ChatGPT. Después de presentar las instrucciones, ChatGPT me hizo varias propuestas que confirmé. Parecía padecer el mismo sesgo de confirmación. Después de fallar varias veces en sus hipótesis, le pedí que investigara sobre el sesgo de confirmación y tratara de evitarlo. Siguiendo mis instrucciones, ChatGPT intentó nuevamente evitar el sesgo de confirmación y propuso una secuencia que no cumplía con su hipótesis inicial; había aprendido. Sin embargo, nunca logró determinar la regla. Aunque comenzó a repetir las mismas hipótesis, en todos los casos evitó el sesgo.
Hoy volví a Bing e inicié nuevamente. El comienzo fue muy parecido, pero después de pedirle que investigara y que evitara el sesgo de confirmación, adivinó la regla en sólo unas cuantas pruebas.
El ChatGPT, así como Bard de Google, tiene impresionantes capacidades para comprender el lenguaje y proporcionar respuestas informativas y generar texto coherente sobre una amplia gama de temas. Sin embargo, la tarea 2-4-6 explota las limitaciones del razonamiento basado en reglas, que no es la principal fortaleza de este modelo de IA. Después de tres intentos en días distintos, ChatGPT puede generar hipótesis y tratar de confirmarlas al sugerir secuencias que se ajustan a la regla dada. También se esfuerza por investigar y experimentar activamente con hipótesis alternativas, logrando integrar una nueva forma de poner a prueba sus hipótesis y finalmente determinar la regla del experimentador.
Después del primer intercambio con Bing, escribí: “El desafío planteado por el problema 2-4-6 destaca las diferencias fundamentales entre la cognición humana y la inteligencia artificial, enfatizando las fortalezas y limitaciones únicas de cada una.” Ahora solo me queda decir que aún queda mucho por saber sobre cuánto más capaz será la inteligencia artificial y en qué nos distinguiremos de ella. A medida que avanzamos en el campo de la IA, comprender estas distinciones será crucial para aprovechar lo mejor de lo humano y lo artificial.