# OpenClaw: el antes y el después de los agentes de IA tal y como los conocemos

> Cómo funciona OpenClaw por dentro: un agente de IA local que se programa sus propias herramientas (self-extension) y decide qué recordar con su memoria híbrida.

- Autor: Gabriel Oliveira Carballo (https://itsgabri.com/sobre-mi/)
- Publicado: 2026-03-02 · Actualizado: 2026-10-05
- URL: https://itsgabri.com/frikadas/openclaw-agentes-de-ia/
- Publicado originalmente en LinkedIn: https://es.linkedin.com/pulse/openclaw-el-antes-y-despu%C3%A9s-de-los-agentes-ia-tal-lo-gabriel-vjhte
- Temas: agentes, OpenClaw, memoria

## En resumen

- **OpenClaw** es un agente de IA de código abierto, impulsado por Peter Steinberger, que se ejecuta en tu propio ordenador con acceso a archivos, terminal, navegador y red.
- **Self-extension:** con solo tres herramientas básicas (leer, escribir y ejecutar comandos) escribe su propio `SKILL.md` y el código de una herramienta nueva, la prueba en un bucle de ensayo y error y la guarda para reutilizarla.
- Funciona con WebSockets: un **Gateway** recibe los mensajes (por ejemplo, de Telegram) y se los pasa al **Pi Agent**, el motor de razonamiento, que llama a herramientas hasta tener la respuesta.
- **Memoria en capas:** sesiones en JSONL, un `MEMORY.md` permanente y notas diarias que pierden peso con el tiempo; la búsqueda combina embeddings, BM25 y MMR y devuelve fragmentos de hasta 700 caracteres.
- La memoria funciona en local y gratis: embeddings con embeddinggemma-300m y almacenamiento en SQLite con sqlite-vec.

La verdad es que con este título parece que estoy sonando a vendehúmos, pero lo cierto es que la magnitud de esta tecnología es una absoluta locura.

Si echamos la vista atrás, recordaremos los comienzos de los LLMs (como las primeras versiones de ChatGPT). Por aquel entonces, lo único que hacían era lanzar respuestas a nuestras preguntas, y ya nos parecía una gran revolución. Después, la siguiente gran revolución fue darles herramientas: poder buscar en internet, usar una calculadora o leer un PDF. Y de ahí a los agentes con herramientas de softwares de nuestro día a día: que si se conectaba a nuestro CRM, la versatilidad de los MCP ...

Pero con esas herramientas siempre había un problema enorme. Si el agente cometía un error o la API fallaba, el proceso se rompía y **tenías que encargarte tú** de arreglar el código, dejando huecos importantes en flujos en producción. La limitación histórica de los agentes siempre ha sido su incapacidad para autocorregirse de manera autónoma, su falta de verdadera proactividad y su incapacidad para "despertar" o revivir cuando consideraran necesario para dar un servicio continuo.

OpenClaw ha sido tan aclamado porque logra exactamente esto que tanto faltaba. Ya no es un agente programado para hacer unas cosas, es un agente capaz de auto programarse para hacer lo que el usuario necesita en cualquier momento. Es capaz de crear sus propios flujos para que el humano no se preocupe ni de desarrollarlos.

Desde que vi de lo que era capaz, me obsesioné con entender cómo había logrado semejante cosa. En este artículo voy a intentar explicar la ingeniería que hace posible esta magia. Desgranaremos su arquitectura de nodos que convierte tus dispositivos físicos en extensiones de la IA, su insólita capacidad de auto-extensión para programar sus propias herramientas sobre la marcha, y el brillante sistema de memoria híbrida que le permite recordar todo tu contexto sin depender de la nube.

## ¿Qué cosas hace y cómo las hace?

La inmensa mayoría de los agentes de IA que conocemos hoy en día (como ChatGPT o Claude en su versión web) viven en un entorno estrictamente aislado y con limitaciones. OpenClaw rompe esta barrera, es un agente que **vive en tu propio entorno y no tiene limitaciones**. Tiene acceso a tu memoria RAM, a tu disco duro, a tu terminal de comandos y a tu red. Esto abre un abanico de posibilidades idéntico al que tendría una persona sentada frente a una pantalla.

> *El objetivo de Peter Steinberger no era construir un chatbot más, sino **crear un agente de IA que pudiera hacer en un ordenador exactamente lo mismo que puede hacer un humano**.*

Esto abre un abanico de posibilidades idéntico al que tendría una persona sentada frente a tu pantalla, ya que este agente puede lograr cosas impensables hasta el momento como:

- **Navegación e interacción web real:** Puede abrir un navegador invisible, buscar información, hacer clic en botones y rellenar formularios en páginas web por ti. No se limita a hacer sólo consultas, puede intervenir y actuar sobre las webs. Puede actuar literalmente como un trabajador autónomo y ejecutar tareas que requieren un manejo de interfaz.
- **Manejo de archivos y scripts:** Puede leer tus documentos locales, analizar un Excel, o incluso escribir y ejecutar código en tu ordenador para automatizar una tarea pesada. No tienes que adjuntarle la información, él la puede buscar y encargarse de todo. Sólo acude a ti cuando necesita contraseñas o información que no puede encontrar. Posee una proactividad para sólo molestarte en los casos en los que sin tu ayuda no pueda continuar con su acometido.
- ***Self-extension*:** Si le pides que haga algo para lo que no tiene una herramienta (por ejemplo, conectarse a la API de tu reloj inteligente), es capaz de buscar la documentación en internet, programar su propia herramienta, guardarla en tu disco duro y usarla. No necesita herramientas, él puede crearlas y cuando las necesita no duda en ponerse a generar código para ello.
- **Conexión directa a tus dispositivos:** Cualquier dispositivo físico (tu iPhone, tu MacBook, un servidor o un móvil Android) puede conectarse al Gateway de OpenClaw y actuar como un nodo. A diferencia de un sistema tradicional donde la IA solo vive en un servidor en la nube, en OpenClaw **los nodos le proveen herramientas físicas al agente**. Si la IA decide que necesita ver su entorno, busca en su registro, detecta que tu iPhone está conectado como nodo, y le envía una orden directa. El teléfono hace la foto, devuelve la imagen en milisegundos y la IA la procesa. Todo ocurre de forma privada en tu red local, sin intermediarios y con latencia ultra-baja.

## ¿Cómo es el proceso desde que mando un mensaje hasta que me responde?

La primera de mis preocupaciones al conocer esta tecnología fue entender cómo conseguía dar un resultado tan rápido en sus respuestas. Esta fluidez se debe a que abandona el clásico modelo de petición-respuesta (HTTP/REST) en favor de un flujo bidireccional constante basado en WebSockets.

Cuando le envías un mensaje a través de Telegram, el mensaje no viaja directamente a la IA. Un adaptador en el Gateway hace "*polling*" a la API de Telegram, recoge tu mensaje y lo inyecta en el sistema central. En ese momento, el Gateway identifica tu ID de usuario, recupera el archivo de tu sesión actual y empaqueta un objeto JSON masivo llamado AgentParams. Este paquete contiene tu mensaje, las últimas líneas de contexto de la charla, las reglas sagradas del sistema (System Prompt) y la lista de herramientas disponibles en ese milisegundo.

Este paquete se le entrega al **Pi Agent**, el motor de razonamiento de la IA, dando comienzo a su iteración cognitiva. La IA no genera una respuesta de texto de inmediato, primero evalúa el estado. Si determina que necesita buscar información externa, emite un evento JSON llamando a una herramienta. El Gateway intercepta este evento, ejecuta el código de la herramienta solicitada, y le devuelve un evento con el resultado. Durante este tiempo, la conexión WebSocket permite que la interfaz del usuario muestre en tiempo real qué está "pensando" o qué herramienta está usando la IA. Solo cuando el Pi Agent ha recopilado todos los datos y resuelto el problema interno, emite el evento final de tipo *chat* con la respuesta redactada, que el Gateway enruta de vuelta hacia Telegram.

Una explicación gráfica de ese proceso es el siguiente diagrama que [recuperé en un hilo de Reddit](https://www.reddit.com/media?url=https%3A%2F%2Fpreview.redd.it%2Feveryone-talks-about-clawdbot-openclaw-but-not-many-people-v0-82w3z00uhxig1.jpeg%3Fwidth%3D4320%26format%3Dpjpg%26auto%3Dwebp%26s%3D75b0aafaec773655026610a61bf7d2efe02916c6):

[Imagen: Diagrama de la arquitectura de OpenClaw: el mensaje pasa por el adaptador de canal, el Gateway, el Agent Runner, la API del LLM y el bucle agéntico con herramientas antes de volver al usuario]

*Diagrama extraído de Reddit*

## Self-extension: La gran habilidad del cangrejo

Para entender el que para mí es el mayor logro técnico de OpenClaw, primero hay que entender **por qué se rompían los agentes de IA hasta ahora.**

Si miramos a las generaciones anteriores de agentes autónomos (como los primeros experimentos con AutoGPT o LangChain), todos sufrían del mismo mal, la fragilidad. Estos sistemas dependían de una lista de herramientas pre-programadas por un humano (por ejemplo, buscar_en_google o leer_pdf). Si tú le pedías al agente que extrajera tus métricas de sueño de un reloj Garmin, y el programador original no había creado la herramienta conectar_garmin, el agente colapsaba. O bien entraba en un bucle infinito de errores, o simplemente alucinaba una respuesta inventada. Eran cajas cerradas.

OpenClaw soluciona esto con una capacidad fascinante llamada **Self-extension (Auto-extensión)**. Una vez instauras al agente en tu ordenador se le dan tres herramientas básicas y primigenias: capacidad de leer el disco (ls / read_file), capacidad de escribir (write_to_file), y capacidad de ejecutar comandos en la terminal (bash / exec). Con esos poderes básicos, el LLM que orquesta el Pi Agent puede hacer prácticamente de todo en tu ordenador.

Supongamos que al agente le pido la tarea de que estudie mi rendimiento deportivo basado en los datos de mi pulsera Garmin. Esto es lo que haría OpenClaw para resolver la problemática:

**1. Exploración y detección:** Al recibir tu petición, la IA primero lee su directorio de habilidades (skills/). Utiliza su herramienta de lectura para listar las carpetas disponibles. Al no encontrar nada relacionado con "Garmin", el sistema no devuelve un error al usuario. En su lugar, amparado por las directivas de su **System Prompt** (el archivo src/agents/system-prompt.ts, que le da permiso explícito para escribir código y crear herramientas si el usuario lo necesita), decide fabricar la solución.

**2. Creación del "Manual de Instrucciones" (`SKILL.md`)** Aquí radica la brillantez arquitectónica de OpenClaw. La IA no se pone a escupir código a lo loco. Su primer paso es usar la herramienta write_to_file para crear una nueva carpeta y un archivo llamado skills/garmin/`SKILL.md`. Este archivo Markdown es vital, es el puente semántico entre el código y el cerebro de la IA. En él, la IA escribe su propia documentación: *"Esta herramienta sirve para conectar con Garmin. Requiere que se le pase el parámetro 'días'. Si falla la contraseña, devuelve el error X"*. Está, literalmente, escribiendo el manual para su yo del futuro.

[Imagen: Diagrama de los pasos 1 y 2 de la self-extension: OpenClaw no encuentra la herramienta en skills/, su system prompt le autoriza a crearla y escribe skills/garmin/SKILL.md]

**3. Programación del código ejecutable** Una vez definido el manual, la IA vuelve a usar write_to_file para crear el script real, por ejemplo, skills/garmin/scripts/fetch_data.ts (o un script en Python). Escribe la lógica pura: las llamadas a la API, la gestión de tokens y el procesamiento de los datos.

**4. Prueba y error** Ningún código funciona a la primera, y la IA lo sabe. Para probarlo, OpenClaw usa la terminal para ejecutar el script que acaba de crear de forma local. Si el terminal devuelve un error, la IA lo lee, analiza el fallo, vuelve a usar write_to_file para corregir el error en el código, y lo vuelve a ejecutar. Hace esto en un bucle rapidísimo hasta que el código devuelve el resultado esperado.

**5. Persistencia y evolución** Una vez que el script de Garmin funciona y te devuelve los datos de tu sueño, el proceso termina, pero **la herramienta se queda guardada en tu disco duro**. La próxima vez que le pidas algo relacionado con tu reloj, el agente simplemente leerá el `SKILL.md` que él mismo redactó días atrás y ejecutará el código al instante. Logrando un flujo listo para uso creado una vez surge la necesidad.

[Imagen: Diagrama de los pasos 3 a 5 de la self-extension: escribe el script fetch_data.ts, lo ejecuta en la terminal, corrige los errores hasta que funciona y guarda la herramienta en disco]

Técnicamente, OpenClaw rompe la barrera del creador de herramientas. Utiliza su modelo de lenguaje no solo para charlar, sino como un motor de razonamiento capaz de alterar su propio código fuente local para adaptarse a las necesidades de su usuario. Es la IA creando software para que la IA sea más útil, algo que sinceramente me parece increíble.

## ¿Cómo recupera el contexto el agente?

Cuando la conversación se alarga demasiado, el contexto se llena y los agentes empiezan a olvidar lo primero que dijiste. OpenClaw soluciona esto con una elegancia técnica que roza lo biológico, dividiendo su cerebro en tres capas diferenciadas que trabajan en paralelo.

**1. La Capa Volátil (L1): Sesiones JSONL** Cada conversación que tienes se guarda en archivos .jsonl dentro de la carpeta sessions/. **Estos archivos son indexables en tiempo real**. El gestor de memoria (manager.ts) no diferencia entre una conversación de hace 5 minutos y una de hace 3 semanas. Para OpenClaw, tu historial de chat no es texto muerto, es una fuente de memoria viva. Si hoy preguntas por un bug que mencionaste hace un mes, el sistema recuperará ese fragmento específico con la misma facilidad que recupera tu nombre, basándose puramente en su relevancia vectorial.

**2. La Capa Durable (L2): La distinción entre "Hechos" y "Diario"** Aquí encontramos una de las decisiones de diseño más inteligentes del proyecto. OpenClaw separa la memoria a largo plazo en dos regímenes de tiempo:

- **`MEMORY.md` (Evergreen):** Es un archivo en la raíz que **no tiene una disminución de su importancia a lo largo del tiempo**. Aquí van las verdades absolutas: "El usuario es arquitecto de software", "Prefiere las respuestas concisas". Esta información siempre es relevante, pase el tiempo que pase.
- **memory/`YYYY-MM-DD.md` (Episódica):** Son archivos diarios que sufren una **disminución de su importancia con el tiempo**. Lo que anotaste ayer sobre un error puntual ("El servidor falló en el puerto 3000") es relevante hoy, pero dentro de un año su "peso" matemático habrá bajado casi a cero.

Esta arquitectura imita al cerebro humano: recuerdas tu nombre para siempre (Evergreen), pero olvidas qué cenaste hace tres martes (Episódica con decaimiento).

**3. El motor de recuperación híbrido:** ¿Cómo encuentra el agente el dato exacto entre miles de archivos sin volverse lento? Aquí es donde hay que quitarse el sombrero ante la arquitectura de búsqueda. OpenClaw no usa una búsqueda simple, usa un **Sistema Híbrido de Recuperación Semántica**.

Cuando lanzas una pregunta, el sistema dispara dos procesos en paralelo:

1. **Búsqueda Vectorial (Embeddings):** Captura el *significado*. Si buscas "coche", encontrará "Tesla" aunque la palabra "coche" no aparezca.
2. **Búsqueda BM25 (Full-text):** Captura la *literalidad*. Busca las palabras exactas usando un tokenizador multilingüe avanzado (capaz de procesar español, chino o árabe eliminando partículas irrelevantes).

El sistema toma los resultados de ambos mundos, los combina, aplica el factor de decaimiento temporal (¿es esto demasiado viejo para importar?) y finalmente usa un algoritmo **MMR (Maximal Marginal Relevance)**. Este último paso es genial, sirve para diversificar. Si hay 10 recuerdos casi idénticos, el MMR los filtra para no darte información redundante.

El resultado es que el modelo nunca se traga un contexto de 50.000 tokens. Ingiere pequeños *chunks* (fragmentos) de máximo 700 caracteres, perfectamente citados, quirúrgicamente extraídos de tu historia.

Un detalle técnico que me parece sublime es la arquitectura de datos que el programa tiene sin depender de servicios de pago en la nube. En lugar de externalizar esto a modelos cloud, el sistema utiliza un modelo de embeddings **open source** llamado *[embeddinggemma-300m](https://huggingface.co/google/embeddinggemma-300m)*, que corre localmente en tu máquina. Este modelo convierte ciertos textos en vectores matemáticos que luego se almacenan y buscan usando **SQLite con la extensión sqlite-vec**. Es una arquitectura tremendamente eficiente y elegante, combinando la base de datos más ligera y robusta del mundo (SQLite) con un modelo RAG compacto, permitiendo que tu historial de conversaciones sea indexable, privado y completamente gratuito. Simplemente brillante.

## ¿Cómo decide qué guarda como información?

Quizás lo más fascinante de todo su proceso de almacenamiento es cómo decide qué guardar. No es un script automático el que resume tus charlas. Es el propio agente.

El sistema tiene un mecanismo de seguridad llamado **"Turno silencioso"**. Cuando la conversación se acerca al límite de memoria (por defecto, unos 4.000 tokens), el sistema pausa la interacción con el usuario e inyecta un turno oculto de tipo NO_REPLY con una instrucción crítica:

> *"Write any lasting notes to memory/`YYYY-MM-DD.md`"*

En ese momento, el agente se detiene a reflexionar. Lee la conversación y **él mismo decide qué merece sobrevivir al olvido**. Si habéis estado hablando del tiempo, probablemente no guarde nada. Pero si le diste una clave de API o una instrucción importante, usará su herramienta de escritura para grabarlo en la memoria durable antes de que el sistema "compacte" y borre el chat reciente.

Es una solución brillante porque delega el juicio en quien mejor entiende el contexto: la propia Inteligencia Artificial. Nadie puede resumir una conversación mejor que quien la está manteniendo. Y como vimos antes, este almacenamiento es clave para darnos una sensación de que el agente recuerda y que realmente puede parecer un trabajador humano.

## Y entonces, ¿con qué me quedo?

Después de bucear en las entrañas de OpenClaw, tengo claro que esto no es solo un experimento de código abierto, es un manifiesto sobre hacia dónde debe evolucionar la Inteligencia Artificial. Me llevo dos lecciones fundamentales que creo que definirán el futuro de los agentes autónomos.

**1. Delegar el "Qué" y el "Cómo"** Lo verdaderamente revolucionario de tener un agente con acceso total a tu ordenador (archivos, terminal, red) es el cambio de paradigma en la productividad. Hasta ahora, usábamos la IA para que nos ayudara con el *cómo* ("escríbeme un script en Python"). OpenClaw nos enseña que el futuro está en delegar también el *qué* y dejar que la máquina descubra el *cómo*.

La capacidad de estos agentes para razonar sobre un problema, darse cuenta de que les faltan herramientas y programar su propia solución sobre la marcha es fascinante. Esto libera al humano de la carga de desarrollo: ya no tengo que pensar en cómo conectar mi reloj al ordenador, solo tengo que expresar la necesidad. Ver a una IA escribir, probar y corregir su propio código para serme útil es un vistazo a un futuro donde el software se adapta a nosotros, y no al revés.

**2. El contexto lo es TODO** Pero si algo me ha impactado, es la obsesión de Peter Steinberger por la arquitectura de datos. Una IA, por muy potente que sea, es inútil sin contexto. El modelo de memoria de OpenClaw (esa danza perfecta entre sesiones volátiles y recuerdos permanentes, gestionada localmente) es la pieza que faltaba en el rompecabezas.

El gran éxito de este proyecto es demostrar que un agente solo puede ser verdaderamente inteligente si "recuerda" quién eres con la misma precisión con la que un humano recuerda a un amigo. Esa arquitectura híbrida, donde la máquina decide qué olvidar y qué grabar a fuego en su disco duro, es lo que convierte a un simple chatbot en una extensión real de tu cerebro.

OpenClaw nos ha enseñado que el futuro de los agentes no está en modelos más grandes en la nube, sino en sistemas más integrados en nuestro entorno local, capaces de aprender, evolucionar y recordar. Y sinceramente, creo que con arquitecturas como esta, por fin estamos rozando con la yema de los dedos algo tecnológicamente indistinguible de un compañero humano.

## Preguntas frecuentes

### ¿Qué es OpenClaw?

OpenClaw es un agente de IA de código abierto, impulsado por Peter Steinberger, que vive en tu propio ordenador en lugar de en un entorno aislado en la nube. Puede navegar por la web, leer y escribir archivos, ejecutar código y usar dispositivos conectados (un iPhone, un portátil o un servidor), y se comunica contigo por apps de mensajería como Telegram.

### ¿Qué es la self-extension de OpenClaw?

Es su capacidad de crear herramientas nuevas cuando no tiene una para lo que le pides. Documenta la herramienta en un archivo SKILL.md, escribe el script, lo ejecuta en la terminal, corrige los errores hasta que funciona y lo deja guardado en disco para usarlo la próxima vez.

### ¿Cómo recuerda OpenClaw las conversaciones?

Combina tres capas: las sesiones de chat en archivos JSONL, un archivo MEMORY.md con datos que no caducan y notas diarias (memory/AAAA-MM-DD.md) que pierden relevancia con el tiempo. Para recuperar información mezcla búsqueda vectorial con embeddings, búsqueda por palabras exactas (BM25) y MMR para no repetir resultados.

### ¿Cómo decide OpenClaw qué guardar en la memoria?

Lo decide el propio agente. Cuando la conversación se acerca al límite de contexto (unos 4.000 tokens por defecto), el sistema inyecta un turno silencioso que le pide escribir las notas importantes en el archivo del día, y el agente elige qué merece guardarse antes de que se compacte el chat.
