HomeBlogSelf-Hosting

IA autoalojada sin la nube

«IA autoalojada sin la nube» son dos promesas distintas pegadas juntas. Una es estricta — el modelo en sí corre en tu máquina, nada sale del servidor. La otra es más flexible — el asistente vive en tu servidor, pero las llamadas al modelo por turno siguen yendo a un proveedor de frontera. Ambas son honestas. Ambas te mantienen fuera del lago de datos de un proveedor. Pero cuestan cantidades distintas, se sienten muy diferentes en el uso diario y solo una de ellas es lo que la mayoría de la gente realmente quiere cuando escribe la frase.

15 de agosto de 2026 self-hosting

Cada pocos meses una nueva oleada de personas escribe «IA autoalojada sin la nube» en un buscador. La mitad quiere una IA que pueda usar en el avión sin Wi-Fi. La otra mitad quiere un asistente que viva en su vida durante años sin que su historial de conversaciones resida en la cuenta de otra persona. La misma frase, dos objetivos, dos respuestas distintas. Este artículo los separa claramente para que no acabes construyendo el equivocado.

Lo que «sin la nube» puede significar honestamente en 2026

Hay exactamente dos formas coherentes que encajan en la frase, y un impostor.

Forma 1 — Totalmente local, pesos incluidos. Un modelo de peso abierto (Llama, Mistral, Qwen, Gemma, variantes locales de DeepSeek) corre en una máquina que tú posees a través de Ollama, llama.cpp, LM Studio, vLLM o similar. El agente que lo envuelve — memoria, orquestación, interfaz de chat — también corre localmente. Cero paquetes salen del servidor para la inferencia. Esta es la «IA sin nube» estricta. Es real, funciona hoy y tiene una advertencia: la calidad.

Forma 2 — Agente autoalojado, modelo en la nube. La memoria, el historial, la personalidad y la orquestación corren en tu servidor. El modelo en sí se llama a través de una API — Claude, GPT, DeepSeek, Gemini. El texto del turno actual sale del servidor; el archivo creciente de todo lo que le has dicho alguna vez a tu asistente no. Esta forma es más flexible, pero es lo que «IA sin la nube» suele significar en la práctica para quienes también quieren el cerebro de un modelo de frontera.

Impostor — productos «privados» en la nube. Los niveles «enterprise» o «privado» de ChatGPT, Claude y Gemini viven en la infraestructura del proveedor con un addendum de privacidad. Eso es una forma legal, no técnica. Nada cambia en el flujo de datos. Si tu definición de «sin la nube» es arquitectónica, esto no lo es.

Qué conservas realmente, y a qué renuncias

Ambas formas honestas te dan las mismas ventajas: el archivo de tus conversaciones vive en hardware que tú controlas, nadie puede reiniciar silenciosamente tu memoria ni cerrar tu cuenta, y no estás pagando alquiler por una copia de ti mismo. La soberanía que la gente persigue realmente cuando dice «sin nube» tiene que ver en un 95% con ese archivo, no con los pesos del modelo.

El intercambio se separa en el modelo:

  • Sin nube estricto (Forma 1) — nada sale de la máquina, nunca. El coste es principalmente único (hardware). La calidad está notablemente por detrás de Claude/GPT/Gemini en tareas complejas, trabajo multilingüe, contexto largo y uso de herramientas. Bien para redactar, asistencia con notas, fragmentos de código, preguntas de una línea. Doloroso para un flujo de trabajo real de «colega en el messenger».
  • Agente autoalojado + modelo en la nube (Forma 2) — el texto del turno actual (con justo el contexto suficiente) va al proveedor del modelo. Tu archivo no. El coste es un VPS de $5–15/mes más el uso del modelo. La calidad es de frontera — el mismo cerebro que ChatGPT, solo que llevando tus datos.

Cuál quieres realmente

Corta a través del marketing con tres preguntas:

  1. ¿Necesitas trabajar sin conexión / en una máquina aislada? Entonces tiene que ser la Forma 1. Sin compromiso.
  2. ¿Tu problema es «el proveedor posee mi historial»? Entonces la Forma 2 ya lo resuelve — el archivo es lo que la gente quiere decir cuando dice «mis datos».
  3. ¿Necesitas razonamiento de frontera en varios idiomas, documentos largos o uso de herramientas agéntico? Entonces solo la Forma 2 lo ofrece hoy; los modelos locales todavía están poniéndose al día.

La mayoría de las personas que escriben «IA sin la nube» están respondiendo la pregunta 2, no la pregunta 1. Se identifican con la Forma 1 porque suena más principista, luego ejecutan un modelo local de 8B, descubren que no puede mantener una conversación real y concluyen que «la IA autoalojada no está lista». Lo que realmente ocurrió: eligieron la forma equivocada para su objetivo.

Hardware, con honestidad

Para la Forma 1. Una GPU de consumo con 24GB+ de VRAM (RTX 3090/4090, o una A5000/A6000 de segunda mano) o un Mac con Apple Silicon y 32–64GB de memoria unificada. Solo CPU es posible para modelos de 3–7B pero los tokens por segundo se sienten como escribir bajo el agua. Presupuesto: $800–$3000 de entrada, $0/mes después.

Para la Forma 2. Un VPS de $5–15/mes con 2–4 GB de RAM y sin GPU. El coste del modelo aparte — Claude Max a ~$100/mes, u OpenAI + recargas API $20–50/mes según el volumen. Total: ~$25–115/mes, sin desembolso de capital.

Observa que la Forma 2 es más barata al inicio y la Forma 1 es más barata a lo largo de los años. Ambas son radicalmente más baratas que el coste de que tus datos acaben siendo usados en tu contra — que es la razón real por la que estabas buscando IA sin nube.

La sensación en el uso diario

Forma 1 en uso diario. Respuestas instantáneas (sin red), sin límites de tasa, sin coste por mensaje. Pero las respuestas a preguntas no triviales se sitúan en algún punto entre «colega junior sólido» y «seguro pero equivocado». Los documentos largos estresan la ventana de contexto. Cualquier cosa que requiera uso de herramientas o JSON fiable es una lucha. El trabajo de voz / visión / varios idiomas es inconsistente. Es un asistente real, no uno excelente.

Forma 2 en uso diario. Un cerebro de calidad frontera habla a través de un asistente que te recuerda, inicia mensajes, guarda tus archivos y nunca entrega el archivo. La latencia es un viaje de ida y vuelta por la red. El coste recae por turno. Confías en que el proveedor del modelo no registra el texto por turno a largo plazo — esa confianza está definida por su política, no por la arquitectura. Para la mayoría de los usuarios el intercambio vale la pena; para los más exigentes en privacidad, no.

Ninguna está mal. Ninguna es universalmente correcta. Elige según qué esquina estás realmente dispuesto a perder.

El híbrido que la gente construye una vez que ha probado ambas

Casi todo el mundo que ejecuta ambas durante un mes acaba en la misma forma: un asistente autoalojado que usa por defecto un modelo en la nube para la calidad, y cae hacia un modelo local para una clase específica de turnos — archivos sensibles, modo sin conexión o trabajo con material que legalmente no puede salir del servidor. El agente decide por turno a dónde va la llamada. Ese es el pico honesto de «IA sin la nube» — sin nube cuando importa, calidad de nube cuando no importa.

Dónde encaja Avelina

Avelina AI es la Forma 2 por defecto — un asistente autoalojado que mantiene tu archivo en tu VPS, inicia mensajes, aloja sub-agentes especialistas y llama al modelo al que te suscribes (Claude, OpenAI, o una ruta de OpenRouter a DeepSeek y otros). Si la Forma 1 encaja con tu caso — sin conexión, aislado o con una política estricta de «ningún paquete sale de la máquina» — la misma arquitectura corre contra un endpoint local de Ollama; cambias la URL del modelo, la pila de memoria y personalidad sigue funcionando. Un asistente, dos rutas de modelo, un archivo que nunca sale de tu servidor.

Para el análisis completo entre nube y autoalojado, el artículo hermano es IA autoalojada vs IA en la nube. Si estás valorando si vale la pena en absoluto, ¿vale la pena autoalojar la IA? es la versión honesta. Y si ya sabes la forma que quieres, la guía de construcción la recorre de principio a fin.

Preguntas frecuentes

¿Puedo ejecutar realmente IA sin ninguna nube?
Sí — los modelos de peso abierto pequeños y medianos (Llama, Mistral, Qwen, Gemma) corren localmente hoy. La calidad está por detrás de los modelos de frontera en la nube, así que el 100% sin nube es real pero normalmente se siente como un paso atrás.

¿Cuál es la diferencia entre IA autoalojada e IA sin nube?
El autoalojamiento cubre ambas formas: pesos locales (estrictamente sin nube) y agente autoalojado que llama a un modelo en la nube (sin nube de forma flexible). Sin nube específicamente significa pesos locales.

¿Necesito una GPU?
Para inferencia realmente sin nube, sí (24GB+ de VRAM o un Mac con Apple Silicon con 32–64GB de memoria unificada). Para la forma de agente autoalojado + modelo en la nube, un VPS de $5–15/mes sin GPU es suficiente.

¿Un asistente autoalojado que usa un modelo en la nube sigue siendo «sin la nube»?
Parcialmente. Tu archivo es sin nube. El texto por turno no. Para la mayoría de las personas el intercambio — datos locales, cerebro en la nube — es el punto óptimo honesto.

Modelo local o modelo en la nube con un agente autoalojado — ¿cuál gana en privacidad?
El totalmente local es más estricto. El agente autoalojado + modelo en la nube supera ampliamente a usar ChatGPT / Gemini directamente, porque tu archivo creciente se queda en tu máquina de todos modos.

¿Listo para ejecutar tu IA sin la nube? La instalación tarda minutos.