Self-hosted AI zonder cloud
"Self-hosted AI zonder cloud" is eigenlijk twee beloftes op elkaar geplakt. De ene is streng — het model draait op jouw machine, er verlaat niets de doos. De andere is losser — de assistent leeft op je server, maar per-turn modelaanroepen gaan alsnog naar een frontier-leverancier. Beide zijn eerlijk. Beide houden je uit iemands data lake. Maar ze kosten verschillend, voelen totaal anders in dagelijks gebruik, en maar één ervan is wat de meeste mensen bedoelen als ze de zin intypen.
Om de zoveel maanden typt een nieuwe golf mensen "self-hosted AI zonder cloud" in een zoekbalk. De helft wil een AI die in het vliegtuig zonder wifi werkt. De andere helft wil een assistent die jarenlang in hun leven meeleeft zonder dat hun gesprekshistorie in iemands account belandt. Zelfde zin, twee doelen, twee antwoorden. Dit stuk splitst ze schoon uit elkaar, zodat je niet per ongeluk het verkeerde ding bouwt.
Wat "zonder cloud" in 2026 eerlijk kan betekenen
Er zijn precies twee coherente vormen die bij de zin passen, en één bedrieger.
Vorm 1 — Volledig lokaal, gewichten en alles. Een open-weight model (Llama, Mistral, Qwen, Gemma, lokale DeepSeek-varianten) draait op een machine van jou via Ollama, llama.cpp, LM Studio, vLLM of vergelijkbaar. De agent eromheen — geheugen, orkestratie, chat-UI — draait ook lokaal. Nul pakketten verlaten de doos voor inference. Dit is de strikte "AI zonder cloud." Het bestaat, werkt vandaag, en heeft één maar: kwaliteit.
Vorm 2 — Self-hosted agent, cloudmodel. Het geheugen, de geschiedenis, de persoonlijkheid en de orkestratie draaien op jouw server. Het model zelf wordt via een API aangeroepen — Claude, GPT, DeepSeek, Gemini. Per-turn tekst verlaat de doos; het groeiende archief van alles wat je ooit tegen je assistent hebt gezegd niet. Dit is losser, maar dit is wat "AI zonder cloud" in de praktijk meestal betekent voor wie ook het frontier-brein wil.
Bedrieger — "private" cloudproducten. "Enterprise" of "private" tiers van ChatGPT, Claude en Gemini leven op de infrastructuur van de leverancier met een privacy-addendum. Dat is een juridische vorm, geen technische. Niets aan het datapad verandert. Als jouw definitie van "zonder cloud" architecturaal is, is dit het niet.
Wat je echt behoudt, en wat je opgeeft
Beide eerlijke vormen geven je dezelfde winst: het archief van je gesprekken leeft op hardware die jij beheert, niemand kan stilletjes je geheugen resetten of je account sluiten, en je betaalt geen huur op een kopie van jezelf. De soevereiniteit die mensen eigenlijk najagen als ze "geen cloud" zeggen, gaat voor 95% over dat archief, niet over modelgewichten.
De ruil splitst zich bij het model:
- Strikt cloudloos (Vorm 1) — niets verlaat ooit de machine. Kosten zijn vooral eenmalig (hardware). Kwaliteit ligt merkbaar achter op Claude/GPT/Gemini bij complexe taken, meertalig werk, lange context en tool-use. Prima voor tekstconcepten, notitiehulp, code-snippets, kort-antwoord vragen. Pijnlijk voor een echte "collega-in-messenger" workflow.
- Self-hosted agent + cloudmodel (Vorm 2) — de tekst van de huidige beurt (met net genoeg context) gaat naar de modelleverancier. Je archief niet. Kosten zijn een VPS van $5–15/maand plus modelgebruik. Kwaliteit is frontier — hetzelfde brein als ChatGPT, alleen draagt het jouw data.
Welke je écht wilt
Snijd door de branding heen met drie vragen:
- Moet je offline / op een air-gapped machine werken? Dan moet het Vorm 1 zijn. Geen concessie mogelijk.
- Is jouw probleem "de leverancier bezit mijn geschiedenis"? Dan lost Vorm 2 dat al op — het archief is wat mensen bedoelen met "mijn data".
- Heb je frontier-niveau redeneren nodig over talen heen, lange documenten of agentische tool-use? Dan levert alleen Vorm 2 dat vandaag; lokale modellen zijn aan het inhalen maar er nog niet.
Wie "AI zonder cloud" intypt beantwoordt meestal vraag 2, niet vraag 1. Ze klikken op Vorm 1 omdat het principiëler klinkt, draaien een lokaal 8B-model, merken dat het geen echt gesprek kan voeren, en concluderen "self-hosted AI is nog niet klaar". Wat er echt gebeurde: verkeerde vorm voor het doel.
Hardware, eerlijk
Voor Vorm 1. Een consumenten-GPU met 24GB+ VRAM (RTX 3090/4090, of een tweedehands A5000/A6000) of een Mac met Apple Silicon en 32–64GB unified memory. CPU-only kan voor 3–7B modellen maar de tokens-per-seconde voelt als typen onder water. Budget: $800–$3000 vooraf, $0/maand daarna.
Voor Vorm 2. Een VPS van $5–15/maand met 2–4 GB RAM en geen GPU. Modelkosten apart — Claude Max op ~$100/maand, of OpenAI + API top-ups $20–50/maand afhankelijk van volume. Totaal: ~$25–115/maand, geen kapitaalinvestering.
Merk op: Vorm 2 is vooraf goedkoper, Vorm 1 is over jaren goedkoper. Beide zijn radicaal goedkoper dan de kost van je data die uiteindelijk tegen je wordt gebruikt — de eigenlijke reden dat je op cloudloze AI zocht.
Hoe het dagelijks voelt
Vorm 1 in dagelijks gebruik. Directe antwoorden (geen netwerk), geen rate limits, geen kost per bericht. Maar antwoorden op niet-triviale vragen landen ergens tussen "solide junior collega" en "zelfverzekerd fout". Lange documenten stressen het contextvenster. Alles wat tool-use of betrouwbare JSON vereist wordt een gevecht. Stem / beeld / cross-language werk is wisselend. Het is een echte assistent, geen geweldige.
Vorm 2 in dagelijks gebruik. Een brein van frontier-kwaliteit spreekt door een assistent die je onthoudt, berichten initieert, je bestanden bewaart en het archief nooit prijsgeeft. Latency is een netwerk-rondje. Kost wordt per beurt afgerekend. Je vertrouwt de modelleverancier erop dat per-turn tekst niet langdurig gelogd wordt — dat vertrouwen wordt bepaald door hun beleid, niet door de architectuur. Voor de meeste gebruikers is de ruil de moeite waard; voor de paranoïden niet.
Geen van beide is fout. Geen van beide universeel juist. Kies op welke hoek je écht bereid bent te verliezen.
De hybride die mensen bouwen zodra ze beide hebben gevoeld
Bijna iedereen die een maand beide draait komt op dezelfde vorm uit: een self-hosted assistent die standaard een cloudmodel gebruikt voor kwaliteit, en terugvalt op een lokaal model voor een specifieke klasse beurten — gevoelige bestanden, offline modus, of werk met materiaal dat wettelijk niet naar buiten mag. De agent beslist per beurt waar de aanroep heen gaat. Dat is de eerlijke piek van "AI zonder cloud" — cloudloos als het ertoe doet, cloud-kwaliteit als het niet uitmaakt.
Waar Avelina past
Avelina AI is standaard Vorm 2 — een self-hosted assistent die jouw archief op je VPS bewaart, berichten initieert, gespecialiseerde sub-agents host, en welk model je ook maar hebt aangeroepen (Claude, OpenAI, of een OpenRouter-route naar DeepSeek en anderen). Als Vorm 1 bij jouw geval past — offline, air-gapped, of een harde "geen pakketten verlaten de machine" regel — draait dezelfde architectuur tegen een lokaal Ollama-endpoint; je wisselt de model-URL, en de geheugen- en persoonlijkheidsstack blijft werken. Eén assistent, twee modelpaden, één archief dat je doos nooit verlaat.
Voor de volledige afweging tussen cloud en self-hosted is self-hosted AI vs cloud AI de zusstuk. Twijfel je of het überhaupt de moeite is: is self-hosting AI de moeite waard is de eerlijke versie. Weet je al welke vorm je wilt: de bouwgids loopt hem end-to-end door.
Veelgestelde vragen
Kan ik echt AI draaien zonder cloud?
Ja — kleine tot middelgrote open-weight modellen (Llama, Mistral, Qwen, Gemma) draaien vandaag lokaal. Kwaliteit ligt achter op frontier-cloudmodellen, dus 100% cloudloos bestaat echt maar voelt vaak als een stap terug.
Wat is het verschil tussen self-hosted AI en cloudloze AI?
Self-hosted dekt beide vormen: lokale gewichten (strikt cloudloos) en self-hosted agent die een cloudmodel aanroept (los cloudloos). Cloudloos specifiek betekent lokale gewichten.
Heb ik een GPU nodig?
Voor echte cloudloze inference wel (24GB+ VRAM of een Apple Silicon Mac met 32–64GB unified memory). Voor de self-hosted agent + cloudmodel vorm is een VPS van $5–15/maand zonder GPU genoeg.
Is een self-hosted assistent met een cloudmodel nog "zonder cloud"?
Deels. Je archief is cloudloos. Per-turn tekst niet. Voor de meeste mensen is die ruil — lokale data, cloud-brein — de eerlijke sweet spot.
Lokaal model of cloudmodel met self-hosted agent — wat wint op privacy?
Volledig lokaal is strenger. Self-hosted agent + cloudmodel overtreft nog steeds ChatGPT / Gemini direct gebruiken, omdat je groeiende archief hoe dan ook op jouw machine blijft.