# ¿Cómo funciona realmente una IA por dentro?

> Qué pasa dentro de un LLM desde que le haces una pregunta: tokens, embeddings, pesos, redes neuronales y atención, explicado paso a paso y sin tecnicismos.

- Autor: Gabriel Oliveira Carballo (https://itsgabri.com/sobre-mi/)
- Publicado: 2026-03-17 · Actualizado: 2026-10-05
- URL: https://itsgabri.com/frikadas/como-funciona-una-ia-por-dentro/
- Publicado originalmente en LinkedIn: https://es.linkedin.com/pulse/c%C3%B3mo-funciona-realmente-una-ia-por-dentro-gabriel-oliveira-carballo-xneqe
- Temas: LLM, redes neuronales, fundamentos

## En resumen

- Un LLM trocea el texto en **tokens** de unos 3 o 4 caracteres y los convierte en **embeddings**: listas de cientos o miles de números que sitúan cada concepto en un mapa matemático.
- A cada embedding se le suma un **vector de posición** para que el modelo sepa en qué orden van las palabras.
- Cada neurona multiplica sus entradas por unos **pesos**, suma un **sesgo** y pasa el resultado a la siguiente capa; un modelo tiene decenas de capas, a veces más de 100.
- Esos pesos se ajustan durante el entrenamiento con **retropropagación**: el modelo predice palabras billones de veces y corrige sus números cada vez que falla.
- La **atención** (Query, Key y Value) relaciona cada palabra con las demás; la respuesta se genera token a token, reutilizando cálculos de la **KV Cache**, hasta el token de fin (EOS).

La curiosidad que impulsa este artículo nació de la necesidad de entender un concepto que no tenía del todo claro, el concepto de los pesos en las redes neuronales. Esa duda me llevó a pasar la última semana estudiando en profundidad su funcionamiento y hoy comparto esos conocimientos con vosotros.

Tras muchas horas de estudio, me he quedado realmente sorprendido por lo poco que realmente se sabe sobre el funcionamiento real de la IA por dentro. Me he quedado preocupado por el peligro que existe en que en el futuro esa álgebra lineal que mantiene en pie la IA sea lo que tome decisiones en el mundo.

Por ello he decidido sentarme y explicar con calma lo que sucede dentro de esta caja negra para que un público no técnico pueda realmente entender lo asombroso que es su funcionamiento.

Imaginemos un caso práctico, subís a la IA un PDF de 150 páginas y le pedís: *"Resume los puntos más importantes de este artículo"*. A continuación, explico el paso a paso que sigue la máquina para darte una respuesta.

## Asimilación de la petición

Lo primero que hace el sistema es descomponer la complejidad del PDF en partes manejables. Usará scripts para separar el PDF en partes. Separará por un lado las imágenes y por otro el texto, mandando el texto hacia un tokenizador y el contenido visual a una Red Neuronal de visión.

El **tokenizador** toma los miles de caracteres del documento y los trocea en fragmentos de unos 3 o 4 caracteres llamados **tokens**. Esta partición se realiza para estandarizar la información y procesarla de manera óptima. En este saco también entra el texto de tu pregunta (el *prompt*).

Mientras tanto, las **Redes neuronales de visión** traducen las imágenes al lenguaje de las redes neuronales, los embeddings. Estas representaciones vectoriales son, básicamente, listas de muchos números (el estándar suele ser 768, pero puede superar los miles por token) que permiten identificar un concepto en un espacio matemático. Esto es lo que permite a la IA relacionar ideas.

Imagina un mapa gigante, pero en lugar de países, situamos conceptos. En la esquina derecha estaría todo lo relacionado con "Vigo": gaviotas, color celeste, olivos, luces de Navidad... Cuando al modelo (LLM) le llega un **embedding** con números (coordenadas) cercanos a esa esquina, sabe matemáticamente que el concepto tiene relación con Vigo. Este es el lenguaje de la IA.

[Imagen: Representación de cómo sería ese mapa gigante.]

*Representación de cómo sería ese mapa gigante.*

Volviendo a nuestro proceso: tenemos el texto partido en tokens y las imágenes convertidas en vectores. El siguiente paso es convertir esos tokens de texto también en embeddings (vectores numéricos).

Una vez tenemos todos los vectores, se les suma un ingrediente clave: el **vector de posición**. Esto le indica a la IA en qué orden aparecen las palabras (no es lo mismo "el oso mata al hombre" que "el hombre mata al oso").

> *Vector("Celta") + Vector(Posición 45.000 en el texto) = Vector Final.*

Con esto, los datos ya están traducidos y listos. Comienza el trabajo del cerebro digital.

## Explicación de las Redes Neuronales

Antes de seguir con el proceso es importante pararnos a entender un concepto. El modelo funciona a través de **redes neuronales**, una representación informática inspirada en cómo nuestro cerebro transmite estímulos. Estas lo hacen con un objetivo de predecir lo que queremos y dárnoslo.

Podríamos simplificar su operativa como un gran sistema de filtrado por capas. Imaginemos que entra la frase "La vida es". La red, en su primera capa, analiza rasgos simples, en la siguiente busca relaciones gramaticales, en la siguiente, el significado del conjunto... y así a través de decenas de capas (a veces más de 100) hasta encontrar un patrón y calcular, estadísticamente, la palabra más apropiada para continuar la frase.

Cada neurona artificial tiene una estructura interna definida por **pesos** y **sesgos**. Siendo el peso un número que multiplica cada parte de la entrada (dándole más o menos importancia). Y el sesgo un número fijo que se suma al resultado para ajustar el umbral de activación. La fórmula de activación quedaría tal que así:

> `z = (w1·x1) + (w2·x2) + … + (wn·xn) + b`

Esa fórmula resultará en un umbral de activación z que dará una información a la siguiente capa sobre la naturaleza del token. Pasándole así información que hará que cambie su activación.

[Imagen: Una neurona de una capa oculta conectada al resultado de otras neuronas realizando el mecanismo de activación explicado.]

*Una neurona de una capa oculta conectada al resultado de otras neuronas realizando el mecanismo de activación explicado.*

Ese "patrón" que digo que encuentra, es lo que la IA ha aprendido durante su entrenamiento. Durante este, se obligó al modelo a predecir palabras billones de veces. Si fallaba en su predicción, se aplicaba un proceso llamado **retropropagación** (*backpropagation*) que reestructuraba los números que había en cada neurona, haciendo así millones de cambios para que el modelo en esos casos dé el vector apropiado.

Esto es lo más impresionante y el motivo de este artículo.

> *La IA no comprende el mundo como nosotros, sino que aprende representaciones estadísticas de él.*

¿No es fascinante?

Nuestras vidas dependen cada vez más de que una red haya calibrado correctamente millones de números en millones de pequeñas neuronas. En neurociencia, cuando tú aprendes a andar en bici, tu cerebro *también* está cambiando la fuerza de conexión (pesos) entre tus neuronas biológicas. La IA replica en gran parte el funcionamiento de nuestro cerebro, pero con la diferencia de que posee mucha más capacidad real de computación que nuestro órgano vital.

## La atención y la generación

Volviendo a nuestro PDF. Esa matriz de vectores entra inicialmente en un mecanismo crucial llamado **Self-Attention** (Auto-atención).

En esta parte cada vector se divide en 3 sub-vectores: Query (lo que busca ese token), Key (lo que es) y Value (lo que es de manera profunda). Cada palabra multiplica su Q con todas las K de cada token, dando como resultado puntuaciones de relación entre palabras.

Por ejemplo, si un token en un texto de fútbol es la palabra “marcó”, esta estará buscando a un jugador que haya marcado un gol. Entonces, cuando encuentre otro token que sea “Iago Aspas” o “golazo” su proximidad será mucho más alta que otras palabras como "Deportivo" o "banquillo".

El sistema realiza estas multiplicaciones masivas en paralelo. A medida que la información atraviesa las capas, los vectores se van enriqueciendo con el contexto de los demás. Al llegar al final de la red, el **último vector** de la fila (el que corresponde al final de tu pregunta) ha absorbido, gracias a la atención, la información relevante de todo el PDF anterior.

Ese último vector pasa por una última capa final de la red neuronal que lo traduce a una predicción, la primera palabra de la respuesta.

Una vez generada la primera palabra, sucede el bucle de generación. El sistema **no vuelve a leer el PDF entero**. Recupera de su memoria caché (*KV Cache*) los cálculos que ya hizo sobre el documento y solo procesa la nueva palabra generada para predecir la siguiente. Repetirá este proceso hasta que la predicción estadística sea un token invisible llamado **EOS** (*End Of Sequence*), que marca el final de la respuesta.

[Imagen: Representación del proceso de generación de respuesta del LLM.]

*Representación del proceso de generación de respuesta del LLM.*

Después si le haces una pregunta posterior a su respuesta, recogerá todo el contenido de la conversación (tus respuestas, las suyas y el contenido que le hayas subido), volverá a crear ese vector con todo el contexto y repetirá paso a paso la danza que acabo de explicar para formular la frase.

## ¿Un futuro regido por el álgebra?

Es increíble lo poco que sabemos como sociedad sobre qué es una IA por dentro. La aceptación social ha sido tan rápida que hemos asumido que entenderla es "cosa de científicos", y creo sinceramente que eso es peligroso.

Una IA no es más que miles de millones de números intentando predecir la siguiente palabra basándose en estadística y álgebra lineal. Nada más. No hay consciencia, solo predicción.

**¿Qué sentido tiene entonces que estas predicciones rijan el futuro de nuestra vida?**

Sinceramente, aún no he encontrado mi respuesta. Antes, esas predicciones y planes los hacían personas. Sus pensamientos también eran, en cierto modo, predicciones, pero guiadas (quizás) por un objetivo de bien común o una ética humana. Estos modelos no tienen objetivos ni ética, tienen funciones de pérdida y optimización matemática.

Son aparentemente solo números. Entonces yo os planteo dos preguntas:

**¿Cómo puede el álgebra lineal mejorar nuestro mundo?**

**Y lo más importante, ¿deberíamos dejar que lo haga sola?**

Gracias por leerme.

## Preguntas frecuentes

### ¿Qué son los pesos de una red neuronal?

Son los números que multiplican cada entrada de una neurona artificial y deciden cuánta importancia tiene. Junto con el sesgo, determinan cómo se activa la neurona y qué información pasa a la siguiente capa. Entrenar un modelo consiste en ajustar miles de millones de estos pesos.

### ¿Qué es un embedding?

Es la representación de un token o de una imagen como una lista de números (a menudo 768 o más). Esos números funcionan como coordenadas en un mapa de conceptos: las ideas relacionadas quedan cerca unas de otras, y así el modelo puede relacionarlas.

### ¿Qué es el mecanismo de atención de un LLM?

Es el paso en el que cada token se compara con todos los demás para decidir cuáles le importan. Cada vector se divide en Query (lo que busca), Key (lo que es) y Value; multiplicar la Query de un token por las Keys del resto da una puntuación de relación entre palabras.

### ¿Entiende una IA lo que dice?

No como una persona. Un LLM aprende representaciones estadísticas del mundo y predice la siguiente palabra con álgebra lineal. No tiene consciencia, objetivos ni ética propios: tiene funciones de pérdida y optimización matemática.
