HomeBlogSelf-Hosting

IA auto-hospedada sem a nuvem

"IA auto-hospedada sem a nuvem" são duas promessas diferentes coladas juntas. Uma é estrita — o próprio modelo roda na sua máquina, nada sai da caixa. A outra é mais flexível — o assistente vive no seu servidor, mas as chamadas de modelo por turno ainda vão para um provedor de fronteira. Ambas são honestas. Ambas mantêm você fora do lago de dados de um fornecedor. Mas custam valores diferentes, parecem muito diferentes no uso diário, e apenas uma delas é o que a maioria das pessoas realmente quer quando digita a frase.

15 de agosto de 2026 self-hosting

A cada poucos meses uma nova onda de pessoas digita "IA auto-hospedada sem a nuvem" em uma barra de pesquisa. Metade quer uma IA que possa rodar no avião sem Wi-Fi. A outra metade quer um assistente que viva na sua vida por anos sem que o histórico de conversas fique dentro da conta de outra pessoa. Mesma frase, dois objetivos, duas respostas diferentes. Este artigo os separa claramente para que você não acabe construindo o errado.

O que "sem a nuvem" pode honestamente significar em 2026

Existem exatamente dois formatos coerentes que se encaixam na frase, e um impostor.

Formato 1 — Totalmente local, pesos e tudo. Um modelo de peso aberto (Llama, Mistral, Qwen, Gemma, variantes locais do DeepSeek) roda em uma máquina que você possui via Ollama, llama.cpp, LM Studio, vLLM ou similar. O agente que o envolve — memória, orquestração, interface de chat — também roda localmente. Zero pacotes saem da caixa para inferência. Esta é a "IA sem a nuvem" estrita. É real, funciona hoje, e tem uma ressalva: qualidade.

Formato 2 — Agente auto-hospedado, modelo na nuvem. A memória, o histórico, a personalidade e a orquestração rodam no seu servidor. O próprio modelo é chamado via API — Claude, GPT, DeepSeek, Gemini. O texto por turno sai da caixa; o arquivo crescente de tudo que você já disse ao seu assistente, não. Isso é mais flexível, mas é o que "IA sem a nuvem" geralmente significa na prática para pessoas que também querem o cérebro de modelo de fronteira.

Impostor — produtos "privados" na nuvem. Níveis "enterprise" ou "privados" do ChatGPT, Claude e Gemini vivem na infraestrutura do fornecedor com um adendo de privacidade. Isso é um formato legal, não técnico. Nada no caminho dos dados muda. Se sua definição de "sem a nuvem" é arquitetural, isso não é.

O que você realmente mantém e o que abre mão

Ambos os formatos honestos dão as mesmas vantagens: o arquivo das suas conversas vive em hardware que você controla, ninguém pode silenciosamente redefinir sua memória ou desligar sua conta, e você não paga aluguel por uma cópia de si mesmo. A soberania que as pessoas realmente buscam quando dizem "sem nuvem" é 95% sobre esse arquivo, não sobre pesos de modelo.

O trade se divide no modelo:

  • Sem nuvem estrito (Formato 1) — nada sai da máquina, nunca. O custo é principalmente único (hardware). A qualidade fica visivelmente atrás de Claude/GPT/Gemini em tarefas complexas, trabalho multilíngue, contexto longo e uso de ferramentas. Funciona bem para rascunhos, assistência a notas, trechos de código, perguntas de uma linha. Doloroso para um fluxo de trabalho real de "colega no mensageiro".
  • Agente auto-hospedado + modelo na nuvem (Formato 2) — o texto do turno atual (com apenas contexto suficiente) vai ao provedor do modelo. Seu arquivo não. O custo é um VPS de $5–15/mês mais uso do modelo. A qualidade é de fronteira — o mesmo cérebro que o ChatGPT, só que usando seus dados.

Qual você realmente quer

Corte o marketing com três perguntas:

  1. Você precisa trabalhar offline / em uma máquina air-gapped? Então tem que ser o Formato 1. Sem compromisso.
  2. Seu problema é "o fornecedor possui meu histórico"? Então o Formato 2 já resolve isso — o arquivo é o que as pessoas querem dizer quando dizem "meus dados".
  3. Você precisa de raciocínio de nível de fronteira em idiomas, documentos longos ou uso de ferramentas agênticas? Então apenas o Formato 2 entrega hoje; os modelos locais ainda estão se atualizando.

A maioria das pessoas que digita "IA sem a nuvem" está respondendo à pergunta 2, não à pergunta 1. Elas fazem o padrão mental do Formato 1 porque parece mais principiado, depois rodam um modelo local de 8B, descobrem que não consegue manter uma conversa real e concluem que "IA auto-hospedada não está pronta". O que realmente aconteceu: escolheram o formato errado para o objetivo.

Hardware, honestamente

Para o Formato 1. Uma GPU de consumidor com 24GB+ de VRAM (RTX 3090/4090, ou um A5000/A6000 usado) ou um Mac com Apple Silicon e 32–64GB de memória unificada. Somente CPU é possível para modelos de 3–7B, mas os tokens por segundo parecem digitação debaixo d'água. Orçamento: $800–$3000 adiantado, $0/mês depois.

Para o Formato 2. Um VPS de $5–15/mês com 2–4 GB de RAM e sem GPU. Custo do modelo separado — Claude Max a ~$100/mês, ou OpenAI + recargas de API $20–50/mês dependendo do volume. Total: ~$25–115/mês, sem desembolso de capital.

Note que o Formato 2 é mais barato adiantado e o Formato 1 é mais barato ao longo dos anos. Ambos são radicalmente mais baratos do que o custo dos seus dados serem eventualmente usados contra você — que é o motivo real pelo qual você estava pesquisando IA sem nuvem em primeiro lugar.

A sensação no dia a dia

Formato 1 no uso diário. Respostas instantâneas (sem rede), sem limites de taxa, sem custo por mensagem. Mas respostas a perguntas não triviais chegam em algum lugar entre "colega júnior sólido" e "confiante mas errado". Documentos longos estressam a janela de contexto. Qualquer coisa que exija uso de ferramentas ou JSON confiável é uma luta. Trabalho com voz, visão e entre idiomas é inconsistente. É um assistente real, não um ótimo.

Formato 2 no uso diário. Um cérebro de qualidade de fronteira fala por meio de um assistente que se lembra de você, inicia mensagens, guarda seus arquivos e nunca entrega o arquivo. A latência é uma ida e volta pela rede. O custo é por turno. Você está confiando ao provedor do modelo que não registre o texto por turno a longo prazo — essa confiança é definida pela política deles, não pela arquitetura. Para a maioria dos usuários o trade vale a pena; para os mais paranóicos não.

Nenhum está errado. Nenhum está universalmente certo. Escolha pelo canto que você realmente está disposto a perder.

O híbrido que as pessoas constroem depois de sentir os dois

Quase todo mundo que roda os dois por um mês acaba no mesmo formato: um assistente auto-hospedado que por padrão usa um modelo na nuvem para qualidade, e cai para um modelo local para uma classe específica de turnos — arquivos sensíveis, modo offline ou trabalho com material que legalmente não pode sair da caixa. O agente decide por turno onde a chamada vai. Esse é o pico honesto de "IA sem a nuvem" — sem nuvem quando importa, qualidade de nuvem quando não importa.

Onde a Avelina se encaixa

Avelina AI é o Formato 2 por padrão — um assistente auto-hospedado que mantém seu arquivo no seu VPS, inicia mensagens, hospeda sub-agentes especialistas e chama qualquer modelo que você assina (Claude, OpenAI ou uma rota OpenRouter para DeepSeek e outros). Se o Formato 1 se encaixa no seu caso — offline, air-gapped ou uma política rígida de "nenhum pacote sai da máquina" — a mesma arquitetura roda contra um endpoint local do Ollama; você troca a URL do modelo, a stack de memória e personalidade continua funcionando. Um assistente, dois caminhos de modelo, um arquivo que nunca sai da sua caixa.

Para o trade-off completo entre nuvem e auto-hospedado, o artigo irmão é IA auto-hospedada vs IA na nuvem. Se você está ponderando se vale a pena, vale a pena hospedar IA você mesmo é a versão honesta. E se já sabe o formato que quer, o guia de construção percorre do começo ao fim.

Perguntas Frequentes

Posso realmente rodar IA sem nenhuma nuvem?
Sim — modelos de peso aberto de pequeno a médio porte (Llama, Mistral, Qwen, Gemma) rodam localmente hoje. A qualidade fica atrás dos modelos de nuvem de fronteira, então 100% sem nuvem é real, mas geralmente parece um passo atrás.

Qual a diferença entre IA auto-hospedada e IA sem nuvem?
Auto-hospedada cobre os dois formatos: pesos locais (estritamente sem nuvem) e agente auto-hospedado chamando um modelo na nuvem (levemente sem nuvem). Sem nuvem especificamente significa pesos locais.

Preciso de uma GPU?
Para inferência realmente sem nuvem, sim (24GB+ de VRAM ou um Mac com Apple Silicon com 32–64GB de memória unificada). Para o formato de agente auto-hospedado + modelo na nuvem, um VPS de $5–15/mês sem GPU é suficiente.

Um assistente auto-hospedado usando um modelo na nuvem ainda é "sem a nuvem"?
Parcialmente. Seu arquivo é sem nuvem. O texto por turno não é. Para a maioria das pessoas o trade — dados locais, cérebro na nuvem — é o ponto ideal honesto.

Modelo local ou modelo na nuvem com agente auto-hospedado — qual vence em privacidade?
Totalmente local é mais estrito. Agente auto-hospedado + modelo na nuvem ainda supera em muito o uso direto de ChatGPT / Gemini, porque seu arquivo crescente fica na sua máquina de qualquer forma.

Pronto para rodar sua IA sem a nuvem? A instalação leva minutos.