{"id":21924,"date":"2024-05-23T11:27:09","date_gmt":"2024-05-23T16:27:09","guid":{"rendered":"https:\/\/www.alvarezjoseph.com\/blog\/?p=21924"},"modified":"2024-05-23T11:27:11","modified_gmt":"2024-05-23T16:27:11","slug":"lo-que-sucede-dentro-de-la-red-neuronal-de-chatgpt-una-mirada-reveladora","status":"publish","type":"post","link":"https:\/\/www.alvarezjoseph.com\/blog\/lo-que-sucede-dentro-de-la-red-neuronal-de-chatgpt-una-mirada-reveladora\/","title":{"rendered":"Lo Que Sucede Dentro de la Red Neuronal de ChatGPT: Una Mirada Reveladora"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><strong>\u00bfTe has preguntado c\u00f3mo funciona realmente la mente de un modelo de lenguaje masivo (LLM)?<\/strong> La <a href=\"https:\/\/www.anthropic.com\/research\/mapping-mind-language-model\" target=\"_blank\" rel=\"noopener\">investigaci\u00f3n reciente de Anthropic<\/a> ofrece una visi\u00f3n fascinante y detallada sobre los intrincados mecanismos internos de estos modelos. <strong>Prep\u00e1rate para descubrir un nuevo mundo<\/strong> de redes neuronales y su funcionamiento oculto.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Explorando el Interior de un LLM<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Para la mayor\u00eda de los programas inform\u00e1ticos, es posible rastrear el c\u00f3digo y el uso de la memoria para entender por qu\u00e9 se produce un comportamiento espec\u00edfico. Sin embargo, en el campo de la <strong>IA generativa<\/strong>, las redes neuronales no interpretables hacen que esto sea un reto, incluso para los expertos. <strong>Las confabulaciones y errores<\/strong> son dif\u00edciles de explicar.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ahora, <strong>Anthropic ha abierto una ventana<\/strong> a lo que sucede dentro de la \u00abcaja negra\u00bb de Claude LLM. <a href=\"https:\/\/transformer-circuits.pub\/2024\/scaling-monosemanticity\/index.html\" target=\"_blank\" rel=\"noopener\">Su nuevo art\u00edculo<\/a>, \u00abExtracci\u00f3n de caracter\u00edsticas interpretables del soneto de Claude 3\u00bb, describe un m\u00e9todo innovador para explicar c\u00f3mo se activan las neuronas artificiales del modelo.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Abriendo el Cap\u00f3 de Claude<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Al analizar un LLM, es sencillo ver qu\u00e9 neuronas espec\u00edficas se activan ante una consulta. Pero los LLM no almacenan palabras o conceptos en una sola neurona. En cambio, cada concepto se representa a trav\u00e9s de muchas neuronas y cada neurona participa en la representaci\u00f3n de muchos conceptos. <strong>\u00bfC\u00f3mo resolver este l\u00edo?<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Anthropic utiliza <strong>codificadores autom\u00e1ticos dispersos y matem\u00e1ticas complejas<\/strong> para ejecutar un algoritmo de \u00abaprendizaje de diccionario\u00bb. Este proceso destaca los grupos de neuronas que se activan de manera consistente para palabras espec\u00edficas en varias indicaciones de texto.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">El Mapa Conceptual de Claude<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Estos patrones neuronales se clasifican en \u00abcaracter\u00edsticas\u00bb asociadas con determinadas palabras o conceptos. Estas caracter\u00edsticas pueden abarcar nombres propios, conceptos abstractos y, a menudo, representar el mismo concepto en m\u00faltiples idiomas y modos de comunicaci\u00f3n.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">En <a href=\"https:\/\/www.anthropic.com\/news\/decomposing-language-models-into-understandable-components\" target=\"_blank\" rel=\"noopener\">octubre de 2023, <strong>Anthropic demostr\u00f3 este proceso<\/strong><\/a> en modelos peque\u00f1os de una sola capa. Ahora, su nuevo documento ampl\u00eda esto enormemente, identificando decenas de millones de caracter\u00edsticas activas en su modelo Claude 3.0 Sonnet. Este <strong>mapa conceptual<\/strong> muestra una profundidad y amplitud impresionantes, aunque los investigadores advierten que es solo una descripci\u00f3n parcial.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Navegando el Mapa de Caracter\u00edsticas<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Navegar por este mapa de caracter\u00edsticas ayuda a entender c\u00f3mo Claude vincula palabras y conceptos. <a href=\"https:\/\/transformer-circuits.pub\/2024\/scaling-monosemanticity\/features\/index.html?featureId=1M_201767\" target=\"_blank\" rel=\"noopener\">Una caracter\u00edstica etiquetada como \u00abCapitales\u00bb<\/a> se activa fuertemente en \u00abciudad capital\u00bb y en nombres de ciudades como Riga, Berl\u00edn y Montpelier.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">El estudio tambi\u00e9n mide la <strong>\u00abdistancia\u00bb matem\u00e1tica entre caracter\u00edsticas<\/strong>, encontrando \u00abvecindarios de caracter\u00edsticas\u00bb organizados en grupos sem\u00e1nticos. Por ejemplo, la caracter\u00edstica del puente <a href=\"https:\/\/transformer-circuits.pub\/2024\/scaling-monosemanticity\/features\/index.html?featureId=34M_31164353\" target=\"_blank\" rel=\"noopener\">Golden Gate<\/a> est\u00e1 cerca de caracter\u00edsticas como \u00abisla de Alcatraz\u00bb y \u00abterremoto de 1906\u00bb.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Modificando el Comportamiento del Modelo<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">M\u00e1s all\u00e1 de mapear c\u00f3mo un LLM almacena informaci\u00f3n, este conocimiento permite modificar los comportamientos del modelo de maneras espec\u00edficas. Al <strong>ajustar las caracter\u00edsticas<\/strong>, el modelo puede mostrar comportamientos extra\u00f1os. Amplificar la caracter\u00edstica del puente Golden Gate, por ejemplo, hizo que el modelo comenzara a describirse como el puente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Este tipo de ajuste sugiere que <strong>las caracter\u00edsticas son esenciales<\/strong> para c\u00f3mo el modelo representa y utiliza el mundo internamente. Controlar caracter\u00edsticas espec\u00edficas puede cambiar significativamente el comportamiento del modelo.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\">Potencial y Riesgos del Ajuste de Caracter\u00edsticas<\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Los investigadores advierten que ajustar caracter\u00edsticas espec\u00edficas es complicado y se necesita m\u00e1s investigaci\u00f3n para entender los efectos a largo plazo. Sin embargo, este marco de Anthropic es un paso prometedor hacia <strong>hacer los resultados de los LLM m\u00e1s interpretables y controlables<\/strong>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Tabla: Comparaci\u00f3n de Caracter\u00edsticas<\/strong><\/p>\n\n\n\n<figure class=\"wp-block-table\"><table><thead><tr><th>Caracter\u00edstica<\/th><th>Ejemplos de Activaci\u00f3n<\/th><th>Relaci\u00f3n Sem\u00e1ntica<\/th><\/tr><\/thead><tbody><tr><td>Capitales<\/td><td>\u00abciudad capital\u00bb, \u00abRiga\u00bb<\/td><td>Nombres de ciudades<\/td><\/tr><tr><td>Puente Golden Gate<\/td><td>\u00abpuente\u00bb, \u00abSan Francisco\u00bb<\/td><td>Monumentos y lugares hist\u00f3ricos<\/td><\/tr><tr><td>Alcatraz<\/td><td>\u00abisla\u00bb, \u00abprisi\u00f3n\u00bb<\/td><td>Lugares de inter\u00e9s<\/td><\/tr><\/tbody><\/table><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Lista de Puntos Clave<\/strong><\/p>\n\n\n\n<ol class=\"wp-block-list\">\n<li><strong>OpenAI no copi\u00f3 la voz de Scarlett Johansson<\/strong>.<\/li>\n\n\n\n<li><strong>Johansson afirm\u00f3<\/strong> que OpenAI copi\u00f3 su voz sin permiso.<\/li>\n\n\n\n<li><strong>Documentos y grabaciones<\/strong> muestran que la actriz fue contratada antes de contactar a Johansson.<\/li>\n\n\n\n<li><strong>La voz de Sky<\/strong> se detuvo mientras se aclaran las afirmaciones.<\/li>\n\n\n\n<li><strong>La controversia refleja preocupaciones \u00e9ticas<\/strong> sobre el uso de voces e im\u00e1genes sin consentimiento.<\/li>\n<\/ol>\n\n\n\n<p class=\"wp-block-paragraph\">La investigaci\u00f3n de Anthropic destaca c\u00f3mo se pueden interpretar y controlar los modelos de IA. Aunque todav\u00eda hay mucho por descubrir, <strong>este es un gran paso<\/strong> hacia un futuro donde podamos comprender mejor y gestionar las capacidades de la IA generativa.<\/p>\n\n\n<div class=\"kk-star-ratings kksr-auto kksr-align-center kksr-valign-bottom\"\n    data-payload='{&quot;align&quot;:&quot;center&quot;,&quot;id&quot;:&quot;21924&quot;,&quot;slug&quot;:&quot;default&quot;,&quot;valign&quot;:&quot;bottom&quot;,&quot;ignore&quot;:&quot;&quot;,&quot;reference&quot;:&quot;auto&quot;,&quot;class&quot;:&quot;&quot;,&quot;count&quot;:&quot;0&quot;,&quot;legendonly&quot;:&quot;&quot;,&quot;readonly&quot;:&quot;&quot;,&quot;score&quot;:&quot;0&quot;,&quot;starsonly&quot;:&quot;&quot;,&quot;best&quot;:&quot;5&quot;,&quot;gap&quot;:&quot;5&quot;,&quot;greet&quot;:&quot;Valora el post&quot;,&quot;legend&quot;:&quot;0\\\/5 - (0 votos)&quot;,&quot;size&quot;:&quot;24&quot;,&quot;title&quot;:&quot;Lo Que Sucede Dentro de la Red Neuronal de ChatGPT: Una Mirada Reveladora&quot;,&quot;width&quot;:&quot;0&quot;,&quot;_legend&quot;:&quot;{score}\\\/{best} - ({count} {votes})&quot;,&quot;font_factor&quot;:&quot;1.25&quot;}'>\n            \n<div class=\"kksr-stars\">\n    \n<div class=\"kksr-stars-inactive\">\n            <div class=\"kksr-star\" data-star=\"1\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"2\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"3\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"4\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" data-star=\"5\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n    \n<div class=\"kksr-stars-active\" style=\"width: 0px;\">\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n            <div class=\"kksr-star\" style=\"padding-right: 5px\">\n            \n\n<div class=\"kksr-icon\" style=\"width: 24px; height: 24px;\"><\/div>\n        <\/div>\n    <\/div>\n<\/div>\n                \n\n<div class=\"kksr-legend\" style=\"font-size: 19.2px;\">\n            <span class=\"kksr-muted\">Valora el post<\/span>\n    <\/div>\n    <\/div>\n","protected":false},"excerpt":{"rendered":"<p>\u00bfTe has preguntado c\u00f3mo funciona realmente la mente de un modelo de lenguaje masivo (LLM)? La investigaci\u00f3n reciente de Anthropic ofrece una visi\u00f3n fascinante y detallada sobre los intrincados mecanismos internos de estos modelos. Prep\u00e1rate para descubrir un nuevo mundo de redes neuronales y su funcionamiento oculto. Explorando el Interior de un LLM Para la [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":21926,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[72],"tags":[],"class_list":["post-21924","post","type-post","status-publish","format-standard","has-post-thumbnail","category-noticias-de-tecnologia"],"_links":{"self":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/21924","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/comments?post=21924"}],"version-history":[{"count":0,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/posts\/21924\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media\/21926"}],"wp:attachment":[{"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/media?parent=21924"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/categories?post=21924"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.alvarezjoseph.com\/blog\/wp-json\/wp\/v2\/tags?post=21924"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}