セルフホストAI クラウドなし
「クラウドなしのセルフホストAI」は2つの異なる約束を貼り合わせたものです。ひとつは厳密——モデル自体があなたのマシン上で動き、何もボックスから外に出ません。もうひとつは緩い——アシスタントはあなたのサーバーに住んでいますが、ターンごとのモデル呼び出しはフロンティアプロバイダーに向けて出ていきます。どちらも正直です。どちらもベンダーのデータレイクからあなたを遠ざけます。でも費用が異なり、日常の使い心地がまったく違い、そのフレーズを検索するほとんどの人が実際に欲しいものは一方だけです。
数ヶ月ごとに新しい波の人々が「クラウドなしのセルフホストAI」を検索バーに入力します。半分はWi-Fiなしの飛行機でも動くAIが欲しい人です。もう半分は、自分の会話履歴が誰かのアカウントの中に何年も存在せずに済むアシスタントが欲しい人です。同じフレーズ、2つの目的、2つの異なる答え。この記事では、間違ったものを作らないようにきっちり分けます。
「クラウドなし」が2026年に正直に意味できること
このフレーズに合う形は正確に2つあり、もうひとつは偽物です。
形1——完全ローカル、モデルの重みも含めて。 オープンウェイトモデル(Llama、Mistral、Qwen、Gemma、DeepSeekのローカル版)が、Ollama、llama.cpp、LM Studio、vLLMなどを通じてあなたが所有するマシン上で動きます。それをラップするエージェント——記憶、オーケストレーション、チャットUI——もローカルで動きます。推論のためにボックスからパケットが出ることはゼロ。これが厳密な「クラウドなしAI」です。実在し、今日動き、ひとつの注意点があります:品質。
形2——セルフホストエージェント、クラウドモデル。 記憶、履歴、個性、オーケストレーションはあなたのサーバーで動きます。モデル自体はAPI経由で呼び出されます——Claude、GPT、DeepSeek、Gemini。ターンごとのテキストはボックスを出ますが、アシスタントに話したすべての蓄積アーカイブは出ません。これは緩いですが、実際に使う人々が「クラウドなしAI」で意味することが多いのはこちらです。
偽物——「プライベート」クラウド製品。 ChatGPT、Claude、GeminiのEnterpriseまたはPrivateティアはプライバシーに関する付記つきでベンダーのインフラに存在します。それは法的な形であり、技術的な形ではありません。データパスについては何も変わりません。「クラウドなし」の定義がアーキテクチャ的なものなら、これはそれではありません。
実際に保持できるもの、失うもの
どちらの正直な形も同じ勝利をもたらします:あなたの会話のアーカイブはあなたがコントロールするハードウェアに存在し、誰もこっそり記憶をリセットしたりアカウントを閉鎖したりできず、あなたのコピーの保管のために費用を払い続ける必要もありません。「クラウドなし」と言うときに人々が実際に追っている主権は、95%がそのアーカイブについてであり、モデルの重みについてではありません。
トレードオフはモデルで分かれます:
- 厳密なクラウドなし(形1) ——何もマシンから出ません、永遠に。コストは主に一回限り(ハードウェア)。複雑なタスク、多言語作業、長いコンテキスト、ツール使用でClaude/GPT/Geminiに明らかに遅れを取ります。下書き、メモ補助、コードスニペット、一行の質問には十分。本物の「メッセンジャーの同僚」ワークフローには辛いです。
- セルフホストエージェント+クラウドモデル(形2) ——現在のターンのテキスト(ちょうど十分なコンテキストとともに)がモデルプロバイダーに行きます。あなたのアーカイブは行きません。コストは月5〜15ドルのVPS+モデル使用料。品質はフロンティア——あなたのデータを持つだけのChatGPTと同じ頭脳です。
実際に欲しいのはどちらか
3つの質問でブランドの飾りを切り抜けましょう:
- オフライン・エアギャップのマシンで作業する必要があるか? なら形1でなければなりません。妥協なし。
- 問題は「ベンダーが私の履歴を所有している」こと? なら形2がすでにそれを解決しています——アーカイブが人々の言う「私のデータ」です。
- 言語、長いドキュメント、またはエージェント的なツール使用にわたるフロンティアレベルの推論が必要か? なら今日は形2だけが届けられます;ローカルモデルはまだ追いかけています。
「クラウドなしAI」と検索するほとんどの人は問い1ではなく問い2に答えています。より原則的に聞こえるので形1にパターンマッチし、ローカルの8Bモデルを動かし、本物の会話ができないと分かり、「セルフホストAIはまだ準備できていない」と結論づけます。実際に起きたこと:目的に合わない形を選んだだけです。
ハードウェア、正直に
形1の場合。 24GB以上のVRAMを持つコンシューマGPU(RTX 3090/4090、または中古のA5000/A6000)、またはApple Siliconと32〜64GBユニファイドメモリを持つMac。CPU-onlyは3〜7Bモデルで可能ですが、トークン毎秒が水中でタイピングしているように感じます。予算:初期費用800〜3,000ドル、その後は月0ドル。
形2の場合。 2〜4GB RAMでGPUなしの月5〜15ドルのVPS。モデルコストは別——Claude Max約月100ドル、またはOpenAI+APIチャージアップで量に応じて月20〜50ドル。合計:月25〜115ドル、初期資本支出なし。
形2は初期コストが低く、形1は年数が経つにつれて安くなります。どちらも、あなたのデータが最終的にあなたに使われることのコストと比べると、根本的に安いです——それが最初にクラウドなしAIを検索した本当の理由です。
日常の使い心地
日常使用での形1。 即座の返答(ネットワークなし)、レートリミットなし、メッセージごとのコストなし。ただし、非自明な質問への回答は「しっかりしたジュニア同僚」から「自信満々な間違い」の間のどこかに着地します。長いドキュメントはコンテキストウィンドウを圧迫します。ツール使用や信頼できるJSONを必要とするものはすべて戦いです。音声・ビジョン・クロスランゲージ作業は一貫性がありません。本物のアシスタントですが、優秀なものではありません。
日常使用での形2。 フロンティアクオリティの頭脳が、あなたを覚え、メッセージを先に送り、ファイルを保管し、アーカイブを決して手放さないアシスタントを通じて話します。レイテンシはネットワークのラウンドトリップです。コストはターンごとにかかります。モデルプロバイダーがターンごとのテキストを長期的にログしないことを信頼しています——その信頼は彼らのポリシーで定義され、アーキテクチャではありません。ほとんどのユーザーにとってそのトレードオフは価値があります;神経質な人にとってはそうではありません。
どちらも間違いではありません。どちらも普遍的に正しくもありません。実際にどのコーナーを失う覚悟があるかで選んでください。
両方を試した後に人々が作るハイブリッド
両方を1ヶ月試したほぼ全員が同じ形に落ち着きます:品質のためにデフォルトでクラウドモデルをデフォルトで使い、特定のターンのクラス——機密ファイル、オフラインモード、法的にボックスを出られない素材の作業——ではフォールスルーしてローカルモデルを使うセルフホストアシスタント。エージェントがターンごとにどこに呼び出しを向けるかを決めます。それが「クラウドなしAI」の正直なピークです——重要なときはクラウドなし、そうでないときはクラウドクオリティ。
Avelinaが当てはまる場所
Avelina AIはデフォルトで形2です——アーカイブをあなたのVPSに保管し、メッセージを先に送り、専門家サブエージェントをホストし、あなたがサブスクライブするモデル(Claude、OpenAI、またはDeepSeekやその他へのOpenRouteルート)を呼び出すセルフホスト型アシスタントです。形1があなたに合う場合——オフライン、エアギャップ、または「パケットはマシンから出ない」というハードなポリシー——同じアーキテクチャがローカルのOllamaエンドポイントに対して動きます;モデルのURLを入れ替えれば、記憶と個性のスタックは動き続けます。1つのアシスタント、2つのモデルパス、あなたのボックスを決して離れない1つのアーカイブ。
クラウドとセルフホストの完全なトレードオフについては、姉妹記事のセルフホストAI vs クラウドAIをご覧ください。そもそも価値があるか検討しているなら、セルフホストAIは価値があるかが正直な版です。そして形が決まっているなら、構築ガイドが端から端まで説明しています。
よくある質問
クラウドなしで本当にAIを動かせるか?
はい——小〜中規模のオープンウェイトモデル(Llama、Mistral、Qwen、Gemma)は今日ローカルで動きます。品質はフロンティアクラウドモデルより劣るので、100%クラウドなしは実在しますが通常は一段下がった感じです。
セルフホストAIとクラウドフリーAIの違いは?
セルフホストは両方の形をカバーします:ローカルモデルの重み(厳密にクラウドなし)とクラウドモデルを呼び出すセルフホストエージェント(緩くクラウドなし)。クラウドフリーは特にローカルモデルの重みを意味します。
GPUが必要か?
本物のクラウドなし推論には、はい(24GB以上のVRAMまたはApple Siliconで32〜64GBユニファイドメモリのMac)。セルフホストエージェント+クラウドモデルの形には、GPUなしの月5〜15ドルのVPSで十分です。
クラウドモデルを使うセルフホストアシスタントはまだ「クラウドなし」か?
部分的に。あなたのアーカイブはクラウドなし。ターンごとのテキストはそうではありません。ほとんどの人にとって、このトレードオフ——ローカルデータ、クラウドの頭脳——が正直なベストポイントです。
ローカルモデルかセルフホストエージェント+クラウドモデル——プライバシーでどちらが勝ち?
完全ローカルの方が厳密です。セルフホストエージェント+クラウドモデルは、どちらにしてもあなたの成長するアーカイブがマシン上に残るため、ChatGPT/Geminiを直接使うよりはるかにプライベートです。
同じアーキテクチャをあなた自身ではなく顧客のために使いたいですか?Avelina for Businessは同じ形で、あなたのブランドアカウント上に展開できます。