Ollama AI系列(1):在 VPS 上部署自托管 AI
2026-07-19 · DevCraft Studio
自托管 Ollama 跑本地大模型(Llama / DeepSeek / Qwen)VPS 怎么选:内存 = 参数÷4 + 2GB,7B→4–6GB、13B→8–12GB、70B→32GB+。CPU 推理慢但便宜,RackNerd / 搬瓦工 / DMIT 推荐配置与避坑。
Ollama 让"在自己服务器上跑大模型"变得人人可上手——一条命令拉模型、开 API,数据不出本机,比调第三方 API 便宜还私密。但 VPS 跑大模型最容易被"7B 只要 4GB 显存"这种话误导:那是 GPU 显存,CPU 推理吃的是内存(RAM),而且量化、上下文、系统开销都要算进去。这篇把配置算清楚。
延伸阅读
更多相关攻略推荐:【年付性价比 01】年付 VPS 性价比排行 2026:同配置谁最值、【API 中转 02】ChatGPT/Claude API 中转 V、DMCA-ignore 海外 VPS 厂商红黑榜:哪些真抗投诉、哪些、【美西VPS 01】美国洛杉矶 VPS 推荐 2026:CN2 GI、【嵌套虚拟化 01】VPS 嵌套虚拟化完全指南:KVM-in-KVM。
内存怎么算(核心公式)
Ollama 用量化模型压低内存占用,经验法则:分配内存 ≈ 模型参数 ÷ 4 + 2GB 系统开销。具体:
- 7B(Llama 3.2 7B、Mistral 7B):最低 4GB,推荐 6GB。入门 VPS 就能跑。
- 13B(Llama 2 13B):最低 8GB,推荐 12GB。中端实例。
- 70B(Llama 2 70B):4-bit 量化最低 32GB,8-bit 要 48GB+。高端档($30–50/月)。
- MoE(Mistral 8x7B):名字迷惑,按 47B 算,需 16–24GB。
存储也别忽略:Llama 2 70B 的 4-bit 就要 35GB,加上系统 3–5GB、Ollama 二进制 0.5GB,安全下限 55GB SSD——很多只给 20–25G 的机器直接出局。
CPU 推理:慢但便宜
没有 GPU 也能跑,纯 CPU 推理比 GPU 慢 5–10 倍(7B 约 1–3 token/秒 vs A100 的 20–50),但月费 $6–15 而非 $100–300。对开发测试、文档分析、低并发(日千次请求)完全够。规则:8 vCPU 跑 7–8B 体感可用;单核性能看架构(Xeon Gold / AMD EPYC 优先,避开十年前的老架构)。RackNerd 促销款 2 核/2GB 约 $2.50/月是甜点入门,RackNerd 年付 $10 出头也能上;要更稳上 DMIT / 搬瓦工。
推荐配置
- 测试 / 个人:2 核/4GB/55G+ SSD,跑 7B(Mistral 7B 量化仅 7.3GB,编码任务比 Llama 7B 强)。月付 $6 级。
- 日常使用:4 核/8–12GB,跑 13B,响应快。Hetzner CPX41 级约 €15/月性价比突出。
- 重度 / 70B:8 核/32GB+,高阶档 $30–50/月;真要快上 GPU VPS($90–360/月)。
避坑要点
第一,别信"7B 只要 4GB"——那是 GPU 显存话术,CPU 机器要按内存公式算,留 2GB 开销。第二,开 swap 兜底:内存不够时 fallocate -l 16G /swapfile 建交换分区,避免大模型 crash。第三,存储留足 55GB+,否则大模型拉不下来。第四,上下文长度(num_ctx)别拉满,8192 够用,拉到 32k 内存直接爆。第五,先月付试水,确认模型响应速度能接受再年付。
常见问题 FAQ
问:4GB 内存能跑 Ollama 吗?答:4GB 勉强能跑 Phi-3、Llama 1B 这类小模型,推理慢、上下文短;稍大点的 7B 会狂吃 swap 甚至崩。真想舒服跑 7–8B,建议 8GB 以上内存或上 GPU。4GB 只适合体验和极轻量任务,别指望它当生产推理服务,显存/内存不够模型直接 OOM。问:一定要 GPU 吗?答:不一定要 GPU,CPU 推理完全能跑只是慢几倍;8 vCPU 跑 7–8B 体感可用,但首 token 延迟高。要流畅、低延迟、能并发,GPU(如 RTX 4090/3090 独服)才值得。预算有限先在 CPU 机试水,确认模型和业务值得再上 GPU,避免盲目加钱。问:最划算方案?答:最划算:先用 RackNerd 促销的 2 核/2GB 款(年付十几美元)试水小模型;日常玩 7–8B 上 4 核/8GB 以上;重度推理或要低延迟并发,直接上带 GPU 的独服/云 GPU。关键看模型大小和并发量——小模型 CPU 够,大模型 GPU 必要,按需升级别一步到位烧钱。
#Ollama #自托管大模型 #本地AI #VPS配置 #DeepSeek #Llama #Qwen #AI推理 #VPS推荐