{"id":40383,"date":"2024-07-13T14:00:00","date_gmt":"2024-07-13T19:00:00","guid":{"rendered":"https:\/\/www.alvarezjoseph.com\/blog\/?p=40383"},"modified":"2024-07-13T11:06:05","modified_gmt":"2024-07-13T16:06:05","slug":"la-verdad-oculta-detras-de-la-vision-de-los-modelos-de-ia","status":"publish","type":"post","link":"https:\/\/www.alvarezjoseph.com\/blog\/la-verdad-oculta-detras-de-la-vision-de-los-modelos-de-ia\/","title":{"rendered":"La Verdad Oculta Detr\u00e1s de la \u00abVisi\u00f3n\u00bb de los Modelos de IA"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">La \u00faltima generaci\u00f3n de modelos de lenguaje, como GPT-4 y Gemini 1.5 Pro, ha sido promocionada como \u00abmultimodal\u00bb, es decir, capaces de entender im\u00e1genes y audio adem\u00e1s de texto. Sin embargo, un nuevo estudio revela que estos modelos no \u00abven\u00bb de la manera que podr\u00edamos esperar. De hecho, podr\u00edan no ver en absoluto.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">La Ilusi\u00f3n de la Visi\u00f3n Artificial<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">\u00bfQu\u00e9 Significa Realmente \u00abVer\u00bb?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Para empezar, es importante aclarar que nadie ha afirmado que estas IA puedan ver como los humanos. Sin embargo, el marketing y los puntos de referencia utilizados para promocionar estos modelos hablan de <a href=\"https:\/\/arxiv.org\/abs\/2407.06581\" target=\"_blank\" rel=\"noopener\">\u00abcapacidades de visi\u00f3n\u00bb y \u00abcomprensi\u00f3n visual\u00bb<\/a>. Se nos dice que estos modelos pueden analizar im\u00e1genes y videos para realizar tareas que van desde resolver problemas escolares hasta ver eventos deportivos.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Aunque estas afirmaciones est\u00e1n formuladas de manera ingeniosa, queda claro que quieren transmitir que el modelo ve en alg\u00fan sentido de la palabra. Pero \u00bfrealmente lo hacen?<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img fetchpriority=\"high\" decoding=\"async\" width=\"1024\" height=\"450\" src=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-8-1024x450.png\" alt=\"-\" class=\"wp-image-40385\" title=\"Imagen de\" srcset=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-8-1024x450.png 1024w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-8-300x132.png 300w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-8-768x337.png 768w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-8-860x378.png 860w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-8.png 1163w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><figcaption class=\"wp-element-caption\">Cr\u00e9ditos de la imagen: Rahmanzadehgervi et al.<\/figcaption><\/figure>\n\n\n\n<h3 class=\"wp-block-heading\">Un Estudio Revelador<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Un estudio realizado por investigadores de la Universidad de Auburn y la Universidad de Alberta prob\u00f3 los modelos multimodales m\u00e1s avanzados en tareas visuales muy simples. Estas pruebas inclu\u00edan tareas como preguntar si dos formas se superponen, contar el n\u00famero de pent\u00e1gonos en una imagen, o identificar qu\u00e9 letra de una palabra est\u00e1 rodeada por un c\u00edrculo. <strong>Tareas que un ni\u00f1o de primer grado podr\u00eda realizar con un 100% de precisi\u00f3n<\/strong>.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img decoding=\"async\" width=\"1024\" height=\"478\" src=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-9-1024x478.png\" alt=\"-\" class=\"wp-image-40386\" title=\"Imagen de\" srcset=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-9-1024x478.png 1024w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-9-300x140.png 300w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-9-768x359.png 768w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-9-860x401.png 860w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-9.png 1161w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><figcaption class=\"wp-element-caption\">Cr\u00e9ditos de la imagen: Rahmanzadehgervi et al.<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Sin embargo, estos modelos de IA no lograron los mismos resultados. Por ejemplo, cuando se les presentaban dos c\u00edrculos que se superpon\u00edan ligeramente, que se tocaban o que estaban a cierta distancia entre ellos, los modelos fallaban en reconocer correctamente la situaci\u00f3n. Aunque GPT-4 tuvo un 95% de \u00e9xito cuando los c\u00edrculos estaban muy separados, su precisi\u00f3n bajaba al 18% cuando las distancias eran cero o peque\u00f1as. Gemini Pro 1.5 fue el mejor, pero a\u00fan as\u00ed solo acert\u00f3 el 70% de las veces en distancias cercanas.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">\u00bfQu\u00e9 Est\u00e1 Fallando?<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">An\u00e1lisis de Datos de Entrenamiento<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">La inconsistencia en los resultados sugiere que los modelos no est\u00e1n \u00abviendo\u00bb de la manera que esperamos. Por ejemplo, cuando se les ped\u00eda contar la cantidad de c\u00edrculos entrelazados en una imagen, los modelos mostraban un rendimiento err\u00e1tico. Aunque todos acertaban el 100% de las veces con cinco anillos, agregar un anillo m\u00e1s devastaba sus resultados. \u00bfLa raz\u00f3n? <strong>Probablemente, porque los Anillos Ol\u00edmpicos, que son cinco, est\u00e1n ampliamente representados en sus datos de entrenamiento<\/strong>, pero seis anillos entrelazados no lo est\u00e1n.<\/p>\n\n\n\n<figure class=\"wp-block-image size-full\"><img decoding=\"async\" width=\"973\" height=\"587\" src=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-10.png\" alt=\"-\" class=\"wp-image-40387\" title=\"Imagen de\" srcset=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-10.png 973w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-10-300x181.png 300w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-10-768x463.png 768w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-10-860x519.png 860w\" sizes=\"(max-width: 973px) 100vw, 973px\" \/><figcaption class=\"wp-element-caption\">Image Credits: IOC<\/figcaption><\/figure>\n\n\n\n<h3 class=\"wp-block-heading\">\u00bfSon Ciegos los Modelos de IA?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Los investigadores concluyen que estos modelos no tienen una comprensi\u00f3n visual real de los conceptos. Aunque \u00abciego\u00bb no es el t\u00e9rmino m\u00e1s preciso, es \u00fatil para describir la incapacidad de estos modelos para hacer juicios visuales. La informaci\u00f3n visual que extraen es abstracta y aproximada, similar a describir una imagen con los ojos cerrados.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Implicaciones y Siguientes Pasos<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">\u00bfSon In\u00fatiles Estos Modelos?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Definitivamente no. Aunque fallan en tareas de razonamiento visual simple, estos modelos son muy precisos en aspectos como interpretar acciones humanas y reconocer objetos cotidianos. <strong>Sus capacidades espec\u00edficas siguen siendo valiosas<\/strong>, pero es crucial entender sus limitaciones.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"597\" src=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-11-1024x597.png\" alt=\"-\" class=\"wp-image-40388\" title=\"Imagen de\" srcset=\"https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-11-1024x597.png 1024w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-11-300x175.png 300w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-11-768x447.png 768w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-11-860x501.png 860w, https:\/\/www.alvarezjoseph.com\/blog\/wp-content\/uploads\/2024\/07\/image-11.png 1030w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><figcaption class=\"wp-element-caption\">Cr\u00e9ditos de imagen: Anh Nguyen<\/figcaption><\/figure>\n\n\n\n<h3 class=\"wp-block-heading\">La Necesidad de Investigaciones Cr\u00edticas<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">El marketing puede llevarnos a pensar que estos modelos tienen una visi\u00f3n perfecta, pero investigaciones como esta demuestran que hay mucho por mejorar. Necesitamos seguir evaluando cr\u00edticamente estas tecnolog\u00edas para comprender mejor sus capacidades y limitaciones.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Conclusi\u00f3n<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">En resumen, aunque los modelos de IA actuales pueden manejar ciertas tareas visuales, su comprensi\u00f3n es limitada y err\u00e1tica. <strong>No ven como los humanos y sus capacidades visuales deben ser tomadas con cautela<\/strong>. La investigaci\u00f3n continua es esencial para mejorar estas tecnolog\u00edas y entender mejor c\u00f3mo pueden ser utilizadas de manera efectiva.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Preguntas Frecuentes<\/h2>\n\n\n\n<h3 class=\"wp-block-heading\">1. \u00bfPueden los modelos de IA realmente ver como los humanos?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">No, los modelos de IA no ven como los humanos. Interpretan patrones en los datos de entrada bas\u00e1ndose en su entrenamiento, pero no tienen una comprensi\u00f3n visual real.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">2. \u00bfSon \u00fatiles estos modelos a pesar de sus limitaciones visuales?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">S\u00ed, estos modelos son muy precisos en tareas espec\u00edficas como reconocer objetos y acciones humanas, aunque fallan en tareas de razonamiento visual simple.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">3. \u00bfQu\u00e9 debemos esperar de la evoluci\u00f3n de estos modelos?<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">Podemos esperar mejoras en su precisi\u00f3n y capacidad para interpretar informaci\u00f3n visual, pero es importante seguir evalu\u00e1ndolos cr\u00edticamente para entender sus verdaderas capacidades y limitaciones.<\/p>\n\n\n<div class=\"kk-star-ratings kksr-auto kksr-align-center kksr-valign-bottom\"\n    data-payload='{&quot;align&quot;:&quot;center&quot;,&quot;id&quot;:&quot;40383&quot;,&quot;slug&quot;:&quot;default&quot;,&quot;valign&quot;:&quot;bottom&quot;,&quot;ignore&quot;:&quot;&quot;,&quot;reference&quot;:&quot;auto&quot;,&quot;class&quot;:&quot;&quot;,&quot;count&quot;:&quot;4&quot;,&quot;legendonly&quot;:&quot;&quot;,&quot;readonly&quot;:&quot;&quot;,&quot;score&quot;:&quot;5&quot;,&quot;starsonly&quot;:&quot;&quot;,&quot;best&quot;:&quot;5&quot;,&quot;gap&quot;:&quot;5&quot;,&quot;greet&quot;:&quot;Valora el post&quot;,&quot;legend&quot;:&quot;5\\\/5 - (4 votos)&quot;,&quot;size&quot;:&quot;24&quot;,&quot;title&quot;:&quot;La Verdad Oculta Detr\u00e1s de la \\u0026quot;Visi\u00f3n\\u0026quot; de los Modelos de IA&quot;,&quot;width&quot;:&quot;142.5&quot;,&quot;_legend&quot;:&quot;{score}\\\/{best} - ({count} {votes})&quot;,&quot;font_factor&quot;:&quot;1.25&quot;}'>\n            \n<div class=\"kksr-stars\">\n    \n<div class=\"kksr-stars-inactive\">\n            <div class=\"kksr-star\" data-star=\"1\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"2\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"3\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"4\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"5\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n    \n<div class=\"kksr-stars-active\" style=\"width: 142.5px;\">\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n<\/div>\n                \n\n<div class=\"kksr-legend\" style=\"font-size: 19.2px;\">\n            5\/5 - (4 votos)    <\/div>\n    <\/div>\n","protected":false},"excerpt":{"rendered":"<p>La \u00faltima generaci\u00f3n de modelos de lenguaje, como GPT-4 y Gemini 1.5 Pro, ha sido promocionada como \u00abmultimodal\u00bb, es decir, capaces de entender im\u00e1genes y audio adem\u00e1s de texto. Sin embargo, un nuevo estudio revela que estos modelos no \u00abven\u00bb de la manera que podr\u00edamos esperar. De hecho, podr\u00edan no ver en absoluto. La Ilusi\u00f3n [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":40384,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[72],"tags":[],"class_list":["post-40383","post","type-post","status-publish","format-standard","has-post-thumbnail","category-noticias-de-tecnologia"],"_links":{"self":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/40383","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/comments?post=40383"}],"version-history":[{"count":0,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/40383\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media\/40384"}],"wp:attachment":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media?parent=40383"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/categories?post=40383"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/tags?post=40383"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}