HomeBlogSelf-Hosting

自托管 AI,不依赖云端

“不依赖云端的自托管 AI”其实是两个不同的承诺被粘在了一起。一个是严格版——模型本身就跑在你的机器上,任何数据都不出这台机器。另一个是宽松版——助理住在你的服务器上,但每一轮的模型调用仍然发往前沿模型提供方。两者都诚实,都能让你不落进厂商的数据湖。但它们花的钱不同,日常使用的感受也大不一样,而且只有其中一个才是大多数人输入这句话时真正想要的。

2026年8月15日 self-hosting

每隔几个月,就会有一批人把“不依赖云端的自托管 AI”敲进搜索框。其中一半想要的是一个在没有 Wi-Fi 的飞机上也能用的 AI。另一半想要的是一个能陪伴他们多年的助理,而对话历史不必躺在别人的账户里。同一句话,两个目标,两种不同的答案。这篇文章把它们干净地拆开,免得你最后建错了那一个。

2026 年,“不依赖云端”能诚实地表示什么

符合这句话的形态恰好有两种,外加一个冒牌货。

形态一——完全本地,连权重一起。一个开放权重的模型(Llama、Mistral、Qwen、Gemma、DeepSeek 的本地变体)通过 Ollama、llama.cpp、LM Studio、vLLM 之类的工具,跑在你自己拥有的机器上。包裹它的那层智能体——记忆、编排、聊天界面——同样在本地运行。推理过程中没有一个数据包离开这台机器。这就是严格意义上的“不依赖云端的 AI”。它是真实的,今天就能用,只有一个附带条件:质量。

形态二——自托管智能体,云端模型。记忆、历史、性格和编排都跑在你的服务器上,模型本身则通过 API 调用——Claude、GPT、DeepSeek、Gemini。每一轮的文本会离开这台机器;而你对助理说过的一切所汇成的、不断生长的档案,不会。这是宽松版,但对那些同时还想要前沿模型大脑的人来说,“不依赖云端的 AI”在实践中通常就是指这个。

冒牌货——“私有”云产品。ChatGPT、Claude 和 Gemini 的“企业版”或“私有”档位,依然运行在厂商的基础设施上,只是附加了一份隐私条款。那是一种法律形态,而不是技术形态。数据路径上没有任何改变。如果你对“不依赖云端”的定义是架构层面的,那这个不算。

你实际保住了什么,又放弃了什么

两种诚实形态给你的收益是一样的:你的对话档案存放在你掌控的硬件上,没有人能悄悄重置你的记忆或关停你的账号,你也不必为一份自己的副本按月交租。人们说“不要云”时真正追求的主权,95% 是关于那份档案的,而不是关于模型权重。

取舍的分岔点在模型这里:

  • 严格无云(形态一)——永远不会有任何数据离开这台机器。成本主要是一次性的(硬件)。在复杂任务、多语言工作、长上下文和工具调用上,质量明显落后于 Claude/GPT/Gemini。用来起草文稿、辅助记笔记、写代码片段、回答一句话的问题都还不错;但要撑起真正“通讯软件里的同事”那种工作流就很吃力。
  • 自托管智能体+云端模型(形态二)——当前这一轮的文本(连同刚好够用的上下文)会发往模型提供方,你的档案则不会。成本是每月 5–15 美元的 VPS 加上模型用量。质量是前沿水准——和 ChatGPT 同一个大脑,只是穿着你的数据。

你真正想要的是哪一个

用三个问题穿透营销话术:

  1. 你需要离线/在物理隔离的机器上工作吗?那就只能选形态一,没有折中余地。
  2. 你的问题是“厂商占有了我的历史记录”吗?那么形态二已经解决了它——人们说“我的数据”时,指的就是那份档案。
  3. 你需要跨语言、长文档或智能体式工具调用中的前沿级推理吗?那么今天只有形态二能交付;本地模型还在追赶。

大多数敲下“不依赖云端的 AI”的人,回答的是第二个问题,而不是第一个。他们凭直觉对上了形态一,因为它听起来更有原则,然后跑起一个本地 8B 模型,发现它撑不住一场真正的对话,于是得出结论:“自托管 AI 还没准备好。”实际发生的是:他们为自己的目标选错了形态。

硬件,说实话

面向形态一。一块 24GB 以上显存的消费级 GPU(RTX 3090/4090,或者二手的 A5000/A6000),或者一台配备 Apple Silicon 与 32–64GB 统一内存的 Mac。纯 CPU 跑 3–7B 模型也可行,但那个每秒 token 数的手感就像在水下打字。预算:前期 800–3000 美元,之后每月 0 美元。

面向形态二。一台每月 5–15 美元、2–4 GB 内存、无 GPU 的 VPS。模型费用另算——Claude Max 约每月 100 美元,或者 OpenAI + API 充值,视用量每月 20–50 美元。合计约每月 25–115 美元,无需资本性支出。

注意,形态二前期更便宜,形态一按年摊算更便宜。而两者都远远便宜过“你的数据最终被用来对付你”的代价——那本来就是你一开始搜索无云 AI 的真正原因。

日常使用的感受

形态一的日常。响应即时(不走网络),没有速率限制,没有按消息计的费用。但面对不那么简单的问题时,答案落在“靠谱的初级同事”和“自信地答错”之间。长文档会把上下文窗口撑满。任何需要工具调用或稳定 JSON 输出的场景都是一场硬仗。语音/视觉/跨语言的表现也不稳定。它是个真的助理,但不是个出色的助理。

形态二的日常。一个前沿质量的大脑,通过一个记得你、会主动发消息、保管着你的文件、并且永不交出档案的助理来说话。延迟是一次网络往返。费用按轮次结算。你需要信任模型提供方不会长期留存每一轮的文本——这份信任由他们的政策界定,而不是由架构保证。对大多数用户来说这笔交换是值得的;对极度谨慎的人来说则不值。

两者都不算错,也都不是放之四海皆准。按你真正愿意让出的那个角落来选。

两种都体验过之后,人们会搭出的混合形态

几乎所有把两种都跑上一个月的人,最后都落到同一个形态:一个自托管助理,默认为了质量走云端模型,并在某一类特定轮次上回落到本地模型——涉及敏感文件、离线模式,或者在法律上不能离开这台机器的材料。由智能体逐轮决定这次调用发往哪里。这就是“不依赖云端的 AI”诚实的顶点——要紧的时候不上云,不要紧的时候享受云端的质量。

Avelina 处在什么位置

Avelina AI 默认属于形态二——一个把档案留在你 VPS 上的自托管助理,会主动发消息,托管各类专职子智能体,并调用你所订阅的任何模型(Claude、OpenAI,或者通过 OpenRouter 路由到 DeepSeek 及其他)。如果形态一才符合你的情况——离线、物理隔离,或者有一条“任何数据包都不得离开这台机器”的硬性政策——同样的架构也可以对接本地的 Ollama 端点;你只需换掉模型地址,记忆与人格那一整套照常工作。一个助理,两条模型路径,一份永远不会离开你机器的档案。

关于云端与自托管之间完整的取舍,姊妹篇是自托管 AI 对比云端 AI。如果你还在掂量它到底值不值得,自托管 AI 值得吗是诚实的那一篇。而如果你已经清楚自己要哪种形态,搭建指南会从头到尾带你走一遍。

常见问题

我真的能完全不依赖云端运行 AI 吗?
能——中小规模的开放权重模型(Llama、Mistral、Qwen、Gemma)今天就能在本地运行。质量落后于前沿云端模型,所以百分之百无云是真实可行的,但通常会感觉像退了一步。

自托管 AI 和无云 AI 有什么区别?
自托管涵盖两种形态:本地权重(严格无云)和调用云端模型的自托管智能体(宽松无云)。而无云特指本地权重。

我需要 GPU 吗?
要做真正的无云推理,需要(24GB 以上显存,或一台配 32–64GB 统一内存的 Apple Silicon Mac)。要做自托管智能体+云端模型这种形态,一台每月 5–15 美元、没有 GPU 的 VPS 就够了。

一个使用云端模型的自托管助理,还算“不依赖云端”吗?
算一部分。你的档案是无云的,每一轮的文本不是。对大多数人来说,数据在本地、大脑在云端,这笔交换是诚实的最佳平衡点。

本地模型,还是配自托管智能体的云端模型——论隐私谁赢?
完全本地更严格。但自托管智能体+云端模型依然远胜于直接使用 ChatGPT/Gemini,因为无论如何,你那份不断生长的档案都留在你自己的机器上。

准备好让你的 AI 摆脱云端了吗?安装只需几分钟。