IA self-hosted senza cloud
"IA self-hosted senza cloud" sono in realtà due promesse incollate insieme. La prima è severa — il modello gira sulla tua macchina, niente esce dalla scatola. La seconda è più larga — l'assistente vive sul tuo server, ma le chiamate al modello per turno vanno comunque a un fornitore frontier. Entrambe sono oneste. Entrambe ti tengono fuori dal data lake di qualcun altro. Ma costano in modo diverso, si sentono in modo totalmente diverso nell'uso quotidiano, e solo una delle due è quello che la maggior parte delle persone intende quando digita la frase.
Ogni tot mesi una nuova ondata di persone digita "IA self-hosted senza cloud" in una barra di ricerca. Metà vuole un'IA che funzioni sull'aereo senza wifi. L'altra metà vuole un assistente che accompagni la loro vita per anni senza che la loro cronologia delle conversazioni finisca dentro un account di qualcuno. Stessa frase, due obiettivi, due risposte. Questo pezzo li separa in modo pulito, così non costruisci per sbaglio la cosa sbagliata.
Cosa può onestamente significare "senza cloud" nel 2026
Ci sono esattamente due forme coerenti che si adattano alla frase, e un impostore.
Forma 1 — Completamente locale, pesi e tutto. Un modello open-weight (Llama, Mistral, Qwen, Gemma, varianti locali di DeepSeek) gira su una macchina tua tramite Ollama, llama.cpp, LM Studio, vLLM o simili. Anche l'agente attorno — memoria, orchestrazione, chat-UI — gira in locale. Zero pacchetti lasciano la scatola per l'inferenza. Questa è l'"IA senza cloud" in senso stretto. Esiste, funziona oggi, e ha un unico ma: la qualità.
Forma 2 — Agente self-hosted, modello cloud. La memoria, la cronologia, la personalità e l'orchestrazione girano sul tuo server. Il modello vero e proprio viene chiamato via API — Claude, GPT, DeepSeek, Gemini. Il testo del turno corrente lascia la scatola; l'archivio che cresce di tutto quello che hai mai detto al tuo assistente no. È più larga, ma è ciò che "IA senza cloud" significa di solito nella pratica per chi vuole anche il cervello frontier.
Impostore — prodotti cloud "private". I piani "enterprise" o "private" di ChatGPT, Claude e Gemini vivono sull'infrastruttura del fornitore con un'appendice sulla privacy. Quella è una forma giuridica, non tecnica. Nulla del percorso dei dati cambia. Se la tua definizione di "senza cloud" è architetturale, questa non lo è.
Cosa tieni davvero, e cosa cedi
Entrambe le forme oneste ti danno lo stesso guadagno: l'archivio delle tue conversazioni vive su hardware che gestisci tu, nessuno può azzerarti la memoria in silenzio o chiuderti l'account, e non paghi un affitto su una copia di te stesso. La sovranità che le persone inseguono davvero quando dicono "niente cloud" riguarda per il 95% quell'archivio, non i pesi del modello.
Il compromesso si divide al livello del modello:
- Rigorosamente senza cloud (Forma 1) — nulla lascia mai la macchina. I costi sono soprattutto una tantum (hardware). La qualità è nettamente dietro a Claude/GPT/Gemini per compiti complessi, lavoro multilingue, contesti lunghi e tool-use. Ottima per bozze di testo, aiuto alle note, snippet di codice, domande a risposta breve. Dolorosa per un vero flusso di lavoro "collega-in-messaggistica".
- Agente self-hosted + modello cloud (Forma 2) — il testo del turno corrente (con abbastanza contesto) va al fornitore del modello. Il tuo archivio no. I costi sono un VPS da 5–15$/mese più l'uso del modello. La qualità è frontier — lo stesso cervello di ChatGPT, solo che porta i tuoi dati.
Quale vuoi davvero
Taglia attraverso il branding con tre domande:
- Devi lavorare offline / su una macchina air-gapped? Allora dev'essere la Forma 1. Nessuna concessione possibile.
- Il tuo problema è "il fornitore possiede la mia cronologia"? Allora la Forma 2 lo risolve già — l'archivio è ciò che le persone intendono con "i miei dati".
- Ti serve un ragionamento di livello frontier tra le lingue, documenti lunghi o tool-use agentico? Allora solo la Forma 2 lo offre oggi; i modelli locali stanno recuperando ma non ci sono ancora.
Chi digita "IA senza cloud" di solito risponde alla domanda 2, non alla 1. Clicca sulla Forma 1 perché suona più di principio, fa girare un modello locale da 8B, si accorge che non riesce a sostenere una conversazione vera, e conclude che "l'IA self-hosted non è pronta". Cos'è successo davvero: forma sbagliata per l'obiettivo.
Hardware, onestamente
Per la Forma 1. Una GPU consumer con 24GB+ di VRAM (RTX 3090/4090, o una A5000/A6000 di seconda mano) oppure un Mac con Apple Silicon e 32–64GB di memoria unificata. Solo CPU può reggere modelli da 3–7B ma i token-al-secondo sembrano digitare sott'acqua. Budget: 800–3000$ in anticipo, 0$/mese poi.
Per la Forma 2. Un VPS da 5–15$/mese con 2–4 GB di RAM e nessuna GPU. Costi del modello a parte — Claude Max a ~100$/mese, oppure OpenAI + top-up API 20–50$/mese a seconda del volume. Totale: ~25–115$/mese, nessun investimento in capitale.
Nota: la Forma 2 è più economica all'inizio, la Forma 1 è più economica su anni. Entrambe sono radicalmente più economiche del costo dei tuoi dati che finiscono per essere usati contro di te — il motivo reale per cui hai cercato IA senza cloud.
Come si sente ogni giorno
Forma 1 nell'uso quotidiano. Risposte immediate (niente rete), nessun rate limit, nessun costo per messaggio. Ma le risposte a domande non banali atterrano da qualche parte tra "solido collega junior" e "sicuro di sé e sbagliato". I documenti lunghi stressano la finestra di contesto. Qualunque cosa richieda tool-use o JSON affidabile diventa una lotta. Voce / immagini / lavoro cross-language è alterno. È un assistente reale, non uno straordinario.
Forma 2 nell'uso quotidiano. Un cervello di qualità frontier parla attraverso un assistente che ti ricorda, avvia messaggi, conserva i tuoi file e non consegna mai l'archivio. La latenza è un round-trip di rete. Il costo si paga per turno. Ti fidi del fornitore del modello sul fatto che il testo per turno non venga loggato a lungo — quella fiducia è determinata dalla sua policy, non dall'architettura. Per la maggior parte degli utenti il compromesso vale; per i paranoici no.
Nessuna delle due è sbagliata. Nessuna è universalmente giusta. Scegli su quale angolo sei davvero disposto a perdere.
L'ibrido che le persone costruiscono appena hanno provato entrambe
Quasi chiunque faccia girare entrambe per un mese arriva alla stessa forma: un assistente self-hosted che di default usa un modello cloud per la qualità, e ripiega su un modello locale per una classe specifica di turni — file sensibili, modalità offline, o lavoro con materiale che legalmente non può uscire. L'agente decide per turno dove va la chiamata. Questo è il picco onesto di "IA senza cloud" — senza cloud quando conta, qualità cloud quando non fa differenza.
Dove si inserisce Avelina
Avelina AI è di default Forma 2 — un assistente self-hosted che conserva il tuo archivio sul tuo VPS, avvia messaggi, ospita sub-agenti specializzati, e usa qualunque modello tu abbia chiamato (Claude, OpenAI, o un percorso OpenRouter verso DeepSeek e altri). Se la Forma 1 si adatta al tuo caso — offline, air-gapped, o una regola dura "nessun pacchetto lascia la macchina" — la stessa architettura gira contro un endpoint locale Ollama; scambi l'URL del modello, e lo stack di memoria e personalità continua a funzionare. Un assistente, due percorsi di modello, un archivio che non lascia mai la tua scatola.
Per il confronto completo tra cloud e self-hosted, IA self-hosted contro IA cloud è il pezzo gemello. Se sei in dubbio se ne valga la pena: vale la pena fare self-hosting dell'IA è la versione onesta. Se sai già quale forma vuoi: la guida di costruzione la percorre da un capo all'altro.
Domande frequenti
Posso davvero far girare l'IA senza cloud?
Sì — i modelli open-weight da piccoli a medi (Llama, Mistral, Qwen, Gemma) girano oggi in locale. La qualità è dietro ai modelli cloud frontier, quindi il 100% senza cloud esiste davvero ma si sente spesso come un passo indietro.
Qual è la differenza tra IA self-hosted e IA senza cloud?
Il self-hosted copre entrambe le forme: pesi locali (rigorosamente senza cloud) e agente self-hosted che chiama un modello cloud (senza cloud in senso largo). "Senza cloud" specificamente significa pesi locali.
Mi serve una GPU?
Per l'inferenza davvero senza cloud sì (24GB+ di VRAM oppure un Mac Apple Silicon con 32–64GB di memoria unificata). Per la forma agente self-hosted + modello cloud basta un VPS da 5–15$/mese senza GPU.
Un assistente self-hosted con un modello cloud è ancora "senza cloud"?
In parte. Il tuo archivio è senza cloud. Il testo per turno no. Per la maggior parte delle persone quel compromesso — dati locali, cervello cloud — è l'onesto sweet spot.
Modello locale o modello cloud con agente self-hosted — cosa vince sulla privacy?
Completamente locale è più severo. Agente self-hosted + modello cloud batte comunque l'uso diretto di ChatGPT / Gemini, perché l'archivio che cresce resta sulla tua macchina in ogni caso.