{"id":40249,"date":"2024-07-01T10:13:01","date_gmt":"2024-07-01T15:13:01","guid":{"rendered":"https:\/\/www.alvarezjoseph.com\/blog\/?p=40249"},"modified":"2024-07-01T10:13:03","modified_gmt":"2024-07-01T15:13:03","slug":"palabras-reveladoras-el-nuevo-rastro-de-los-textos-generados-por-ia","status":"publish","type":"post","link":"https:\/\/www.alvarezjoseph.com\/blog\/palabras-reveladoras-el-nuevo-rastro-de-los-textos-generados-por-ia\/","title":{"rendered":"Palabras Reveladoras: El Nuevo Rastro de los Textos Generados por IA"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">En el mundo de la <strong>inteligencia artificial<\/strong>, las empresas han tenido dificultades para <strong>detectar de manera confiable<\/strong> cu\u00e1ndo un texto se ha generado utilizando un <strong>modelo de lenguaje grande (LLM)<\/strong>. Sin embargo, un grupo de investigadores ha encontrado un m\u00e9todo novedoso para <strong>identificar el uso de LLM<\/strong> en escritos cient\u00edficos, midiendo qu\u00e9 <strong>\u00abpalabras en exceso\u00bb<\/strong> comenzaron a aparecer con m\u00e1s frecuencia durante la era LLM, es decir, <strong>2023 y 2024<\/strong>. Los resultados son sorprendentes: al menos el <strong>10% de los res\u00famenes de 2024<\/strong> parecen haber sido procesados con LLM.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Inspiraci\u00f3n en la Pandemia<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Cuatro investigadores de la <strong>Universidad de Tubinga<\/strong> y la <strong>Universidad Northwestern de Alemania<\/strong> se inspiraron en estudios que med\u00edan el impacto de la pandemia de COVID-19 observando el <strong>exceso de muertes<\/strong>. Aplicaron un enfoque similar al <strong>\u00abuso excesivo de palabras\u00bb<\/strong> despu\u00e9s de que las herramientas de escritura LLM se popularizaran a fines de <strong>2022<\/strong>. Descubrieron que la llegada de los LLM llev\u00f3 a un <strong>aumento abrupto<\/strong> en la frecuencia de ciertas palabras de estilo, un fen\u00f3meno sin precedentes tanto en calidad como en cantidad.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Analizando el Vocabulario<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Para medir estos cambios, los investigadores analizaron <strong>14 millones de res\u00famenes<\/strong> de art\u00edculos publicados en <a href=\"https:\/\/pubmed.ncbi.nlm.nih.gov\/\" target=\"_blank\" rel=\"noopener\">PubMed <\/a>entre <strong>2010 y 2024<\/strong>. Compararon la <strong>frecuencia esperada<\/strong> de ciertas palabras (seg\u00fan la tendencia anterior a 2023) con la <strong>frecuencia real<\/strong> en los res\u00famenes de 2023 y 2024. Encontraron una serie de palabras que eran <strong>extremadamente poco comunes<\/strong> antes de 2023 y que <strong>aumentaron repentinamente<\/strong> despu\u00e9s de la introducci\u00f3n de los LLM.<\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Palabra<\/th><th>Incremento en Uso<\/th><\/tr><\/thead><tbody><tr><td>delves<\/td><td>25 veces m\u00e1s<\/td><\/tr><tr><td>showcasing<\/td><td>9 veces m\u00e1s<\/td><\/tr><tr><td>underscores<\/td><td>9 veces m\u00e1s<\/td><\/tr><tr><td>potential<\/td><td>+4.1%<\/td><\/tr><tr><td>findings<\/td><td>+2.7%<\/td><\/tr><tr><td>crucial<\/td><td>+2.6%<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<h2 class=\"wp-block-heading\">Cambios Naturales del Lenguaje<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Es importante considerar que estos cambios en el uso de palabras podr\u00edan ocurrir de forma natural. Sin embargo, los investigadores notaron que, en la era anterior a los LLM, estos aumentos masivos y repentinos solo se observaban en palabras relacionadas con <strong>eventos de salud mundial<\/strong>: por ejemplo, \u00ab\u00e9bola\u00bb en 2015 y \u00abcoronavirus\u00bb durante la pandemia de COVID-19.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Un Fen\u00f3meno Distinto<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">En contraste, en la era posterior a los LLM, los investigadores encontraron cientos de palabras con <strong>aumentos abruptos<\/strong> en el uso cient\u00edfico, sin un v\u00ednculo com\u00fan con eventos mundiales. A diferencia de las palabras relacionadas con la pandemia, que eran en su mayor\u00eda sustantivos, las palabras con <strong>frecuencia aumentada<\/strong> despu\u00e9s de los LLM eran principalmente <strong>\u00abpalabras de estilo\u00bb<\/strong> como verbos, adjetivos y adverbios.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Detecci\u00f3n y Consecuencias<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Los investigadores estiman que al menos el <strong>10% de los art\u00edculos<\/strong> posteriores a 2022 en PubMed se escribieron con <strong>asistencia de LLM<\/strong>. Este porcentaje puede variar entre diferentes pa\u00edses; por ejemplo, en <strong>China, Corea del Sur y Taiw\u00e1n<\/strong>, el uso de palabras de referencia de LLM es del <strong>15%<\/strong>. Esto sugiere que los LLM podr\u00edan estar <strong>ayudando a los no nativos a editar textos en ingl\u00e9s<\/strong>.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">La Importancia de Detectar LLM<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Detectar el uso de LLM es crucial porque estas herramientas son conocidas por <strong>inventar referencias, proporcionar res\u00famenes inexactos y hacer afirmaciones falsas<\/strong> que pueden sonar convincentes. A medida que el conocimiento sobre las <strong>palabras clave de LLM<\/strong> se difunda, los editores humanos pueden mejorar en <strong>eliminar estas palabras<\/strong> del texto generado antes de publicarlo.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">El Futuro de los Modelos de Lenguaje<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">\u00bfPodr\u00edan los futuros modelos de lenguaje realizar este tipo de an\u00e1lisis de frecuencia por s\u00ed mismos? Es posible que pronto necesitemos nuevas herramientas para identificar el <strong>texto generativo de IA<\/strong> que se esconde entre nosotros.<\/p>\n\n\n\n<hr class=\"wp-block-separator has-alpha-channel-opacity\"\/>\n\n\n\n<p class=\"wp-block-paragraph\">En resumen, los <strong>modelos de lenguaje grandes<\/strong> han dejado una huella detectable en la literatura cient\u00edfica. A trav\u00e9s del an\u00e1lisis de palabras en exceso, los investigadores han abierto una ventana a la identificaci\u00f3n del texto generado por IA, destacando la <strong>compleja interacci\u00f3n<\/strong> entre la tecnolog\u00eda y la evoluci\u00f3n del lenguaje.<\/p>\n\n\n<div class=\"kk-star-ratings kksr-auto kksr-align-center kksr-valign-bottom\"\n    data-payload='{&quot;align&quot;:&quot;center&quot;,&quot;id&quot;:&quot;40249&quot;,&quot;slug&quot;:&quot;default&quot;,&quot;valign&quot;:&quot;bottom&quot;,&quot;ignore&quot;:&quot;&quot;,&quot;reference&quot;:&quot;auto&quot;,&quot;class&quot;:&quot;&quot;,&quot;count&quot;:&quot;3&quot;,&quot;legendonly&quot;:&quot;&quot;,&quot;readonly&quot;:&quot;&quot;,&quot;score&quot;:&quot;5&quot;,&quot;starsonly&quot;:&quot;&quot;,&quot;best&quot;:&quot;5&quot;,&quot;gap&quot;:&quot;5&quot;,&quot;greet&quot;:&quot;Valora el post&quot;,&quot;legend&quot;:&quot;5\\\/5 - (3 votos)&quot;,&quot;size&quot;:&quot;24&quot;,&quot;title&quot;:&quot;Palabras Reveladoras: El Nuevo Rastro de los Textos Generados por IA&quot;,&quot;width&quot;:&quot;142.5&quot;,&quot;_legend&quot;:&quot;{score}\\\/{best} - ({count} {votes})&quot;,&quot;font_factor&quot;:&quot;1.25&quot;}'>\n            \n<div class=\"kksr-stars\">\n    \n<div class=\"kksr-stars-inactive\">\n            <div class=\"kksr-star\" data-star=\"1\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"2\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"3\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"4\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"5\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n    \n<div class=\"kksr-stars-active\" style=\"width: 142.5px;\">\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n<\/div>\n                \n\n<div class=\"kksr-legend\" style=\"font-size: 19.2px;\">\n            5\/5 - (3 votos)    <\/div>\n    <\/div>\n","protected":false},"excerpt":{"rendered":"<p>En el mundo de la inteligencia artificial, las empresas han tenido dificultades para detectar de manera confiable cu\u00e1ndo un texto se ha generado utilizando un modelo de lenguaje grande (LLM). Sin embargo, un grupo de investigadores ha encontrado un m\u00e9todo novedoso para identificar el uso de LLM en escritos cient\u00edficos, midiendo qu\u00e9 \u00abpalabras en exceso\u00bb [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":40251,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[72],"tags":[],"class_list":["post-40249","post","type-post","status-publish","format-standard","has-post-thumbnail","category-noticias-de-tecnologia"],"_links":{"self":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/40249","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/comments?post=40249"}],"version-history":[{"count":0,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/40249\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media\/40251"}],"wp:attachment":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media?parent=40249"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/categories?post=40249"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/tags?post=40249"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}