Kendi sunucunda barındırılan AI — bulut olmadan
"Bulutsuz, kendi sunucunda barındırılan AI" birbirine yapıştırılmış iki ayrı vaat. Biri katı — modelin kendisi senin makinende çalışıyor, kutudan hiçbir şey çıkmıyor. Diğeri gevşek — asistan senin sunucunda yaşıyor ama tur başına model çağrıları yine de bir sınır sağlayıcısına gidiyor. İkisi de dürüst. İkisi de seni bir sağlayıcının veri havuzunun dışında tutuyor. Ama maliyetleri farklı, günlük kullanımda çok farklı hissettiriyorlar ve bu ifadeyi yazan çoğu kişinin gerçekte istediği yalnızca biri.
Birkaç ayda bir yeni bir insan dalgası arama çubuğuna "bulutsuz, kendi sunucunda barındırılan AI" yazıyor. Yarısı uçakta Wi-Fi olmadan çalıştırabileceği bir AI istiyor. Diğer yarısı, konuşma geçmişi başkasının hesabında durmadan yıllarca hayatında yaşayacak bir asistan istiyor. Aynı ifade, iki hedef, iki farklı cevap. Bu yazı ikisini net biçimde ayırıyor ki yanlış olanı inşa etmeyesin.
"Bulutsuz" 2026'da dürüstçe ne anlama gelebilir
İfadeye uyan tam olarak iki tutarlı biçim var, bir de sahtesi.
Biçim 1 — Tamamen yerel, ağırlıklarıyla birlikte. Açık ağırlıklı bir model (Llama, Mistral, Qwen, Gemma, DeepSeek'in yerel varyantları) sahip olduğun bir makinede Ollama, llama.cpp, LM Studio, vLLM ya da benzeri üzerinden çalışıyor. Onu saran ajan — hafıza, orkestrasyon, sohbet arayüzü — de yerel çalışıyor. Çıkarım için kutudan sıfır paket çıkıyor. Katı anlamda "bulutsuz AI" bu. Gerçek, bugün çalışıyor ve tek bir uyarısı var: kalite.
Biçim 2 — Kendi sunucunda barındırılan ajan, bulut modeli. Hafıza, geçmiş, kişilik ve orkestrasyon senin sunucunda çalışıyor. Modelin kendisi bir API üzerinden çağrılıyor — Claude, GPT, DeepSeek, Gemini. Tur başına metin kutudan çıkıyor; asistanına şimdiye kadar söylediğin her şeyin büyüyen arşivi çıkmıyor. Bu daha gevşek ama sınır modeli beynini de isteyen insanlar için pratikte "bulutsuz AI" genelde bunu ifade ediyor.
Sahtesi — "özel" bulut ürünleri. ChatGPT, Claude ve Gemini'nin "kurumsal" ya da "özel" katmanları, bir gizlilik ekiyle birlikte sağlayıcının altyapısında yaşıyor. Bu hukuki bir biçim, teknik değil. Veri yolunda hiçbir şey değişmiyor. "Bulutsuz" tanımın mimari ise, aradığın bu değil.
Gerçekte neyi elinde tutuyorsun, neyden vazgeçiyorsun
Dürüst iki biçim de sana aynı kazanımları veriyor: konuşmalarının arşivi kontrol ettiğin donanımda yaşıyor, kimse hafızanı sessizce sıfırlayamıyor ya da hesabını kapatamıyor ve kendi kopyana kira ödemiyorsun. İnsanlar "bulut yok" derken asıl peşinde koştuğu egemenlik, %95 oranında model ağırlıklarıyla değil o arşivle ilgili.
Takas modelde ayrışıyor:
- Katı bulutsuz (Biçim 1) — makineden hiçbir şey çıkmıyor, hiçbir zaman. Maliyet çoğunlukla tek seferlik (donanım). Kalite ise karmaşık görevlerde, çok dilli işlerde, uzun bağlamda ve araç kullanımında Claude/GPT/Gemini'nin gözle görülür biçimde gerisinde. Taslak yazmak, not desteği, kod parçaları, tek satırlık sorular için yeterli. Gerçek bir "mesajlaşma uygulamasındaki meslektaş" akışı için acı verici.
- Kendi sunucunda barındırılan ajan + bulut modeli (Biçim 2) — mevcut turun metni (yalnızca yeterli bağlamla) model sağlayıcısına gidiyor. Arşivin gitmiyor. Maliyet ayda 5–15$'lık bir VPS artı model kullanımı. Kalite sınır seviyesinde — ChatGPT ile aynı beyin, sadece senin verini giymiş hâlde.
Gerçekte hangisini istiyorsun
Markalamayı üç soruyla kes:
- Çevrimdışı ya da ağdan yalıtılmış bir makinede çalışman gerekiyor mu? O zaman Biçim 1 olmak zorunda. Taviz yok.
- Derdin "geçmişim sağlayıcının elinde" mi? O zaman Biçim 2 bunu zaten çözüyor — insanlar "verim" derken kastettiği şey arşiv.
- Diller arası, uzun belgelerde ya da ajanlı araç kullanımında sınır seviyesinde akıl yürütmeye ihtiyacın var mı? O zaman bugün yalnızca Biçim 2 bunu veriyor; yerel modeller hâlâ arayı kapatıyor.
"Bulutsuz AI" yazan çoğu kişi birinci soruyu değil ikinci soruyu cevaplıyor. Daha ilkeli göründüğü için Biçim 1'e eşleşiyorlar, sonra yerel bir 8B model çalıştırıyor, onun gerçek bir konuşmayı taşıyamadığını görüyor ve "kendi sunucunda barındırılan AI henüz hazır değil" sonucuna varıyor. Gerçekte olan şu: hedefleri için yanlış biçimi seçtiler.
Donanım, dürüstçe
Biçim 1 için. 24 GB+ VRAM'li bir tüketici GPU'su (RTX 3090/4090 ya da ikinci el bir A5000/A6000) ya da 32–64 GB birleşik belleğe sahip Apple Silicon'lı bir Mac. 3–7B modeller için yalnızca CPU mümkün ama saniyedeki token sayısı su altında yazmak gibi hissettiriyor. Bütçe: peşin 800–3000$, sonrasında ayda 0$.
Biçim 2 için. GPU'suz, 2–4 GB RAM'li, ayda 5–15$'lık bir VPS. Model maliyeti ayrı — ayda ~100$'a Claude Max ya da hacme göre ayda 20–50$'lık OpenAI + API yüklemeleri. Toplam: ayda ~25–115$, sermaye harcaması yok.
Dikkat et: Biçim 2 peşinde daha ucuz, Biçim 1 yıllar içinde daha ucuz. İkisi de verinin er ya da geç sana karşı kullanılmasının maliyetinden köklü biçimde daha ucuz — ki en başta bulutsuz AI aramanın asıl sebebi de buydu.
Günlük his
Günlük kullanımda Biçim 1. Anında yanıtlar (ağ yok), hız limiti yok, mesaj başına maliyet yok. Ama önemsiz olmayan sorulara gelen cevaplar "sağlam bir junior meslektaş" ile "kendinden emin biçimde yanlış" arasında bir yere düşüyor. Uzun belgeler bağlam penceresini zorluyor. Araç kullanımı ya da güvenilir JSON gerektiren her şey bir kavga. Ses / görüntü / diller arası iş tutarsız. Gerçek bir asistan, ama harika değil.
Günlük kullanımda Biçim 2. Sınır kalitesinde bir beyin; seni hatırlayan, ilk mesajı atan, dosyalarını tutan ve arşivi asla teslim etmeyen bir asistanın ağzından konuşuyor. Gecikme bir ağ gidiş-dönüşü. Maliyet tur başına düşüyor. Model sağlayıcısının tur başına metni uzun vadeli kaydetmeyeceğine güveniyorsun — bu güveni mimari değil, onların politikası tanımlıyor. Çoğu kullanıcı için takas buna değer; paranoyaklar için değmez.
Hiçbiri yanlış değil. Hiçbiri evrensel olarak doğru değil. Gerçekte hangi köşeyi kaybetmeye razı olduğuna göre seç.
İkisini de yaşayanların sonunda kurduğu melez
Bir ay boyunca ikisini de çalıştıran hemen herkes aynı biçimde son buluyor: kalite için varsayılan olarak bir bulut modeline giden, belirli bir tur sınıfında — hassas dosyalar, çevrimdışı mod ya da yasal olarak kutudan çıkamayacak materyalle çalışma — yerel bir modele düşen kendi sunucunda barındırılan bir asistan. Çağrının nereye gideceğine ajan tur başına karar veriyor. "Bulutsuz AI"ın dürüst zirvesi bu — önemli olduğunda bulutsuz, olmadığında bulut kalitesinde.
Avelina nereye oturuyor
Avelina AI varsayılan olarak Biçim 2 — arşivini kendi VPS'inde tutan, ilk mesajı atan, uzman alt ajanları barındıran ve hangi modele abone olduysan onu çağıran (Claude, OpenAI ya da DeepSeek ve diğerlerine giden bir OpenRouter yolu) kendi sunucunda barındırılan bir asistan. Senin durumuna Biçim 1 uyuyorsa — çevrimdışı, ağdan yalıtılmış ya da katı bir "makineden paket çıkmaz" politikası — aynı mimari yerel bir Ollama uç noktasına karşı çalışıyor; model URL'sini değiştiriyorsun, hafıza ve kişilik katmanı çalışmaya devam ediyor. Tek asistan, iki model yolu, kutundan asla çıkmayan tek arşiv.
Bulut ile kendi sunucunda barındırma arasındaki tam takas için kardeş yazı: kendi sunucunda barındırılan AI ile bulut AI. Genel olarak buna değip değmediğini tartıyorsan, kendi sunucunda AI barındırmaya değer mi dürüst versiyonu. Ve istediğin biçimi zaten biliyorsan, kurulum rehberi onu baştan sona anlatıyor.
SSS
Gerçekten hiç bulut olmadan AI çalıştırabilir miyim?
Evet — küçük ve orta ölçekli açık ağırlıklı modeller (Llama, Mistral, Qwen, Gemma) bugün yerel çalışıyor. Kalite sınır bulut modellerinin gerisinde, yani %100 bulutsuz gerçek ama genelde bir adım geri gitmek gibi hissettiriyor.
Kendi sunucunda barındırılan AI ile bulutsuz AI arasındaki fark ne?
Kendi sunucunda barındırma iki biçimi de kapsıyor: yerel ağırlıklar (katı anlamda bulutsuz) ve bulut modeli çağıran kendi sunucundaki ajan (gevşek anlamda bulutsuz). Bulutsuz ise özellikle yerel ağırlıklar demek.
GPU'ya ihtiyacım var mı?
Gerçek bulutsuz çıkarım için evet (24 GB+ VRAM ya da 32–64 GB birleşik bellekli bir Apple Silicon Mac). Kendi sunucunda barındırılan ajan + bulut modeli biçimi için GPU'suz, ayda 5–15$'lık bir VPS yeterli.
Bulut modeli kullanan, kendi sunucunda barındırılan bir asistan hâlâ "bulutsuz" sayılır mı?
Kısmen. Arşivin bulutsuz. Tur başına metin değil. Çoğu insan için takas — yerel veri, bulut beyni — dürüst orta nokta.
Yerel model mi, kendi sunucunda ajanla bulut modeli mi — gizlilikte hangisi kazanıyor?
Tamamen yerel olan daha katı. Kendi sunucunda ajan + bulut modeli yine de ChatGPT / Gemini'yi doğrudan kullanmayı fersah fersah geçiyor, çünkü büyüyen arşivin her hâlükârda senin makinende kalıyor.
Aynı mimarinin sana değil müşterilerine hizmet etmesini mi istiyorsun? İşletmeler için Avelina aynı biçim, markanın hesabında.