{"id":71101,"date":"2024-10-14T17:15:04","date_gmt":"2024-10-14T22:15:04","guid":{"rendered":"https:\/\/www.alvarezjoseph.com\/blog\/?p=71101"},"modified":"2024-10-14T17:15:06","modified_gmt":"2024-10-14T22:15:06","slug":"los-chatbots-de-ia-no-razonan-aunque-lo-parezca-la-gran-mentira-de-la-inteligencia-artificial-que-piensa","status":"publish","type":"post","link":"https:\/\/www.alvarezjoseph.com\/blog\/los-chatbots-de-ia-no-razonan-aunque-lo-parezca-la-gran-mentira-de-la-inteligencia-artificial-que-piensa\/","title":{"rendered":"Los chatbots de IA no razonan, aunque lo parezca: la gran mentira de la \u00abinteligencia artificial que piensa\u00bb"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">\u00bfAlguna vez has tenido la sensaci\u00f3n de que un chatbot de IA <em>entiende realmente lo que dices<\/em>? A veces hasta parece que pueden \u00abrazonar\u00bb y darte respuestas profundas, como si de verdad tuvieran algo parecido a una mente humana detr\u00e1s. Bueno, <strong>spoiler alert<\/strong>: <em>no es cierto<\/em>. Y hoy vamos a hablar de por qu\u00e9 todo ese cuento de que \u00ablos modelos de IA razonan\u00bb es, b\u00e1sicamente, una ilusi\u00f3n muy bien armada.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">La gran promesa\u2026 y la realidad detr\u00e1s<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Hemos escuchado mucho \u00faltimamente de compa\u00f1\u00edas como OpenAI o Microsoft promoviendo la idea de que sus chatbots tienen la capacidad de \u00abrazonar\u00bb. Esas demostraciones de GPT-4 o los modelos de Microsoft Think Deeper te hacen creer que la inteligencia artificial ya casi ha llegado al nivel de la ciencia ficci\u00f3n. Pero, mira, <strong>nada m\u00e1s lejos de la realidad<\/strong>. Todo es humo.<\/p>\n\n\n\n<blockquote class=\"wp-block-quote is-layout-flow wp-block-quote-is-layout-flow\">\n<p class=\"wp-block-paragraph\">\u00abLos chatbots pueden hablar bonito, pero de razonar, nada.\u00bb<\/p>\n<\/blockquote>\n\n\n\n<p class=\"wp-block-paragraph\">Lo que quiero decir es que la impresi\u00f3n que nos da de que un chatbot <em>entiende<\/em> lo que dices no es m\u00e1s que el resultado de haber procesado much\u00edsima informaci\u00f3n y calcular patrones de probabilidad. <strong>As\u00ed es como funciona<\/strong>: buscan las respuestas que m\u00e1s tienen sentido de acuerdo a los patrones que han aprendido. Pero no es razonamiento, ni conciencia, ni nada por el estilo. A veces aciertan, y otras veces, pues\u2026 la cagan por completo.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Apple pone a prueba a los chatbots: <strong>los resultados revelan sus limitaciones<\/strong><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Para poner esto a prueba, un grupo de seis investigadores de Apple decidi\u00f3 hacer un estudio comparativo sobre diferentes modelos de IA, tanto de c\u00f3digo abierto como propietarios. La idea era simple: veamos hasta qu\u00e9 punto estos modelos son capaces de \u00abrazonar\u00bb y c\u00f3mo se comportan ante ciertas pruebas espec\u00edficas. Evaluaron modelos como Llama, Phi, Gemma, Mistral, GPT-4o y o1. <strong>Y los resultados fueron bastante reveladores.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una de las pruebas m\u00e1s destacadas fue con un <a href=\"https:\/\/x.com\/MFarajtabar\/status\/1844456890832695303\">benchmark llamado <strong>GSM8K<\/strong><\/a>. B\u00e1sicamente, es una bater\u00eda de problemas matem\u00e1ticos que sirve para medir la capacidad de razonamiento matem\u00e1tico de estos modelos. GPT-3, por ejemplo, punt\u00faa con un 35% en este test, mientras que modelos m\u00e1s peque\u00f1os ya superan el 85%. Pero, vamos, que puntuar bien en este test no significa que estos chatbots <em>razonen<\/em>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>\u00bfPor qu\u00e9?<\/strong> Porque si juegas un poquito con el contexto de la pregunta, sustituyendo nombres o valores, \u00a1el modelo se pierde por completo! \u00bfDe qu\u00e9 razonamiento estamos hablando si un simple cambio en el problema los descoloca?<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h3 class=\"wp-block-heading\">Jugando con los nombres: <strong>los modelos no soportan cambios<\/strong><\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Uno de los responsables del estudio, <strong>Mehrdad Farajtabar<\/strong>, <a href=\"https:\/\/x.com\/mfarajtabar\/status\/1844456880971858028\">lo explic\u00f3 bastante bien<\/a>. B\u00e1sicamente, desarrollaron una herramienta llamada <strong>GSM-Symbolic<\/strong> para cambiar valores, nombres propios, e incluso incluir frases adicionales que parec\u00edan relevantes. <strong>\u00bfEl resultado?<\/strong> Cuando cambiaban un nombre o un valor, la precisi\u00f3n de los modelos ca\u00eda dr\u00e1sticamente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Imag\u00ednate esto: est\u00e1s haciendo un examen de matem\u00e1ticas y solo cambias los nombres de los objetos en el problema. De alguna manera, los modelos caen hasta un 10% en su rendimiento. <em>Rid\u00edculo<\/em>, \u00bfno? Quiero decir, si de verdad estuvieran \u00abrazonando\u00bb, deber\u00edan ser capaces de seguir el razonamiento l\u00f3gico independientemente de si hablamos de peras, manzanas o jugadores de f\u00fatbol. <strong>Pero no es as\u00ed.<\/strong> Cambia una frase, a\u00f1ade dos m\u00e1s, y todo se viene abajo.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">\u00bfSon fiables los benchmarks actuales?<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Aqu\u00ed viene la pregunta del mill\u00f3n: <strong>\u00bfpodemos fiarnos de los benchmarks que usamos para evaluar estos modelos?<\/strong> Porque, a ver, cuando te dicen que un modelo ha mejorado un 90% en su capacidad de razonamiento matem\u00e1tico, lo primero que piensas es: \u00abWow, ya casi que razonan mejor que yo\u00bb. Pero la realidad es que estos benchmarks, como el famoso GSM8K, est\u00e1n basados en patrones predecibles. Los modelos se entrenan con los mismos ejemplos una y otra vez. Y claro, es como si estudiaran para el examen sin entender el contenido.<\/p>\n\n\n\n<blockquote class=\"wp-block-quote is-layout-flow wp-block-quote-is-layout-flow\">\n<p class=\"wp-block-paragraph\">\u00abEs f\u00e1cil sacar buena nota si ya te conoces las respuestas de memoria. Pero eso no significa que seas bueno en la materia.\u00bb<\/p>\n<\/blockquote>\n\n\n\n<p class=\"wp-block-paragraph\">Entonces, estos modelos no est\u00e1n \u00abrazonando\u00bb. Est\u00e1n siguiendo patrones, dando las respuestas que m\u00e1s encajan seg\u00fan los ejemplos que han visto durante el entrenamiento. Es como si hubieran memorizado un mont\u00f3n de recetas sin entender realmente c\u00f3mo funciona la cocina; cuando les pides algo ligeramente distinto, tratan de encajar las piezas aunque no tenga mucho sentido. Y eso, en la pr\u00e1ctica, hace que sean <strong>muy vulnerables a los cambios<\/strong>. Cambia una palabra y <em>puf<\/em>, los resultados se desploman.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h3 class=\"wp-block-heading\">El efecto de la informaci\u00f3n irrelevante<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">\u00bfQuieres algo a\u00fan m\u00e1s chistoso? Los investigadores decidieron ir un paso m\u00e1s all\u00e1 y a\u00f1adieron informaci\u00f3n irrelevante a los problemas que los modelos deb\u00edan resolver. Imagina que al problema le a\u00f1ades una frase que no tiene nada que ver, solo para distraer. \u00bfSabes qu\u00e9 pas\u00f3? <strong>Los modelos se confundieron<\/strong>. Bajaron su rendimiento notablemente porque intentaban darle sentido a toda la informaci\u00f3n, aunque fuera basura.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Esto nos dice algo muy claro: estos chatbots <strong>no saben distinguir lo importante de lo irrelevante<\/strong>. Si realmente pudieran razonar, sabr\u00edan que esa informaci\u00f3n extra no aporta nada y la ignorar\u00edan. Pero, en su lugar, intentan encajar todo, como si cada palabra tuviera que ser relevante para la respuesta.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">La IA no puede ganarle al ajedrez de forma razonada<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Otra forma sencilla de demostrar esto es con el ajedrez. <strong>Pon un chatbot de IA generativa a jugar ajedrez<\/strong>. \u00bfQu\u00e9 pasa? Muchas veces acaba haciendo movimientos ilegales, movimientos que cualquier persona que conozca las reglas del juego nunca har\u00eda. Los chatbots parecen m\u00e1s bien como esos jugadores de ajedrez que han memorizado algunas jugadas, pero que en cuanto se salen de lo que conocen, hacen cualquier cosa.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Lo mismo pasa con tareas tan simples como contar letras o multiplicar matrices. Los modelos pueden hacerlo si se han entrenado espec\u00edficamente en esos problemas, pero fallan con frecuencia si cambias m\u00ednimamente las condiciones. <strong>Razonar significa adaptarse<\/strong>, y estos modelos no se adaptan. Solo responden con lo que m\u00e1s se parece a lo que han visto antes.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Lo que todo esto significa para los usuarios: <strong>no te f\u00edes de tu chatbot<\/strong><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Entonces, \u00bfcu\u00e1l es el mensaje aqu\u00ed? Mira, si est\u00e1s usando un chatbot como ChatGPT para tareas que requieren una respuesta precisa y l\u00f3gica, ten mucho cuidado. Estos modelos <em>no entienden<\/em>, <em>no razonan<\/em>, y su fiabilidad puede ser dudosa. Por ejemplo, si les pides resolver un problema matem\u00e1tico con un contexto ligeramente diferente al que conocen, sus respuestas pueden ser completamente incorrectas, mostrando claramente la falta de verdadera comprensi\u00f3n. Parece que saben de lo que hablan, pero basta con hacer la pregunta de una manera un poco diferente para que la respuesta sea completamente err\u00f3nea.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Para tareas que no requieren un an\u00e1lisis profundo, como pedir una receta de cocina o recomendaciones para una pel\u00edcula, <em>genial<\/em>, adelante. Pero si necesitas algo complejo, algo que requiera <strong>pensar<\/strong> de verdad, estos modelos a\u00fan tienen un largo camino por recorrer. Al final del d\u00eda, no hay que olvidar que los chatbots son <strong>herramientas<\/strong>, no cerebros. Y la diferencia entre uno y otro, cr\u00e9eme, sigue siendo enorme.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Resumen R\u00e1pido<\/h2>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>Los chatbots no razonan<\/strong>, solo siguen patrones aprendidos a partir de datos previos.<\/li>\n\n\n\n<li>Los benchmarks actuales, como GSM8K, <strong>pueden ser enga\u00f1osos<\/strong> y no reflejan capacidad real de razonamiento.<\/li>\n\n\n\n<li>Los modelos de IA <strong>fallan cuando se cambian valores<\/strong> o nombres en los problemas que intentan resolver.<\/li>\n\n\n\n<li>A\u00f1adir informaci\u00f3n irrelevante <strong>confunde a los modelos<\/strong>, ya que no distinguen lo importante de lo accesorio.<\/li>\n\n\n\n<li>En tareas como jugar al ajedrez, los chatbots suelen hacer <strong>movimientos ilegales<\/strong>, demostrando sus limitaciones.<\/li>\n\n\n\n<li>Si bien son \u00fatiles para consultas simples, <strong>no hay que confiar en ellos para tareas complejas<\/strong> que requieran verdadero razonamiento.<\/li>\n<\/ol>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<h2 class=\"wp-block-heading\">Preguntas Frecuentes<\/h2>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>\u00bfPueden los chatbots de IA razonar como los humanos?<\/strong><br>No, los chatbots no razonan. Solo analizan patrones basados en datos con los que han sido entrenados, sin comprender el contexto como lo har\u00eda un humano.<\/li>\n\n\n\n<li><strong>\u00bfQu\u00e9 tan fiables son los benchmarks como GSM8K para evaluar chatbots?<\/strong><br>No del todo. Estos benchmarks est\u00e1n dise\u00f1ados para medir habilidades espec\u00edficas, pero no muestran una verdadera capacidad de razonamiento. Son m\u00e1s bien pruebas de memoria que de an\u00e1lisis real.<\/li>\n\n\n\n<li><strong>\u00bfPor qu\u00e9 los chatbots fallan si cambias los nombres en un problema?<\/strong><br>Porque los chatbots se basan en patrones fijos. Cambiar los nombres altera esos patrones, y como no hay comprensi\u00f3n real, el rendimiento cae dr\u00e1sticamente.<\/li>\n\n\n\n<li><strong>\u00bfC\u00f3mo afecta la informaci\u00f3n irrelevante a los chatbots?<\/strong><br>La informaci\u00f3n irrelevante los confunde porque intentan procesar todo lo que se les da. No distinguen entre datos \u00fatiles e in\u00fatiles, lo que impacta su rendimiento.<\/li>\n\n\n\n<li><strong>\u00bfPueden los chatbots jugar al ajedrez correctamente?<\/strong><br>No siempre. Aunque pueden hacer movimientos v\u00e1lidos, muchas veces se equivocan al intentar jugadas complejas, incluso haciendo movimientos que no son legales.<\/li>\n\n\n\n<li><strong>\u00bfSon \u00fatiles los chatbots de IA para tareas complejas?<\/strong><br>No del todo. Pueden ser \u00fatiles para tareas sencillas o repetitivas, pero no son recomendables para tareas que requieran razonamiento profundo o an\u00e1lisis cr\u00edtico.<\/li>\n<\/ol>\n\n\n<div class=\"kk-star-ratings kksr-auto kksr-align-center kksr-valign-bottom\"\n    data-payload='{&quot;align&quot;:&quot;center&quot;,&quot;id&quot;:&quot;71101&quot;,&quot;slug&quot;:&quot;default&quot;,&quot;valign&quot;:&quot;bottom&quot;,&quot;ignore&quot;:&quot;&quot;,&quot;reference&quot;:&quot;auto&quot;,&quot;class&quot;:&quot;&quot;,&quot;count&quot;:&quot;31&quot;,&quot;legendonly&quot;:&quot;&quot;,&quot;readonly&quot;:&quot;&quot;,&quot;score&quot;:&quot;4.6&quot;,&quot;starsonly&quot;:&quot;&quot;,&quot;best&quot;:&quot;5&quot;,&quot;gap&quot;:&quot;5&quot;,&quot;greet&quot;:&quot;Valora el post&quot;,&quot;legend&quot;:&quot;4.6\\\/5 - (31 votos)&quot;,&quot;size&quot;:&quot;24&quot;,&quot;title&quot;:&quot;Los chatbots de IA no razonan, aunque lo parezca: la gran mentira de la \\u0026quot;inteligencia artificial que piensa\\u0026quot;&quot;,&quot;width&quot;:&quot;130.9&quot;,&quot;_legend&quot;:&quot;{score}\\\/{best} - ({count} {votes})&quot;,&quot;font_factor&quot;:&quot;1.25&quot;}'>\n            \n<div class=\"kksr-stars\">\n    \n<div class=\"kksr-stars-inactive\">\n            <div class=\"kksr-star\" data-star=\"1\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"2\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"3\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"4\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"5\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n    \n<div class=\"kksr-stars-active\" style=\"width: 130.9px;\">\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n<\/div>\n                \n\n<div class=\"kksr-legend\" style=\"font-size: 19.2px;\">\n            4.6\/5 - (31 votos)    <\/div>\n    <\/div>\n","protected":false},"excerpt":{"rendered":"<p>\u00bfAlguna vez has tenido la sensaci\u00f3n de que un chatbot de IA entiende realmente lo que dices? A veces hasta parece que pueden \u00abrazonar\u00bb y darte respuestas profundas, como si de verdad tuvieran algo parecido a una mente humana detr\u00e1s. Bueno, spoiler alert: no es cierto. Y hoy vamos a hablar de por qu\u00e9 todo [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":71102,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[72],"tags":[],"class_list":["post-71101","post","type-post","status-publish","format-standard","has-post-thumbnail","category-noticias-de-tecnologia"],"_links":{"self":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/71101","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/comments?post=71101"}],"version-history":[{"count":1,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/71101\/revisions"}],"predecessor-version":[{"id":71103,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/71101\/revisions\/71103"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media\/71102"}],"wp:attachment":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media?parent=71101"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/categories?post=71101"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/tags?post=71101"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}