自托管 Ollama 大模型 VPS 配置 2026:内存怎么算、CPU 够不够
2026-07-19 · DevCraft Studio
自托管 Ollama 跑本地大模型(Llama / DeepSeek / Qwen)VPS 怎么选:内存 = 参数÷4 + 2GB,7B→4–6GB、13B→8–12GB、70B→32GB+。CPU 推理慢但便宜,RackNerd / 搬瓦工 / DMIT 推荐配置与避坑。
Ollama 让"在自己服务器上跑大模型"变得人人可上手——一条命令拉模型、开 API,数据不出本机,比调第三方 API 便宜还私密。但 VPS 跑大模型最容易被"7B 只要 4GB 显存"这种话误导:那是 GPU 显存,CPU 推理吃的是内存(RAM),而且量化、上下文、系统开销都要算进去。这篇把配置算清楚。
内存怎么算(核心公式)
Ollama 用量化模型压低内存占用,经验法则:分配内存 ≈ 模型参数 ÷ 4 + 2GB 系统开销。具体:
- 7B(Llama 3.2 7B、Mistral 7B):最低 4GB,推荐 6GB。入门 VPS 就能跑。
- 13B(Llama 2 13B):最低 8GB,推荐 12GB。中端实例。
- 70B(Llama 2 70B):4-bit 量化最低 32GB,8-bit 要 48GB+。高端档($30–50/月)。
- MoE(Mistral 8x7B):名字迷惑,按 47B 算,需 16–24GB。
存储也别忽略:Llama 2 70B 的 4-bit 就要 35GB,加上系统 3–5GB、Ollama 二进制 0.5GB,安全下限 55GB SSD——很多只给 20–25G 的机器直接出局。
CPU 推理:慢但便宜
没有 GPU 也能跑,纯 CPU 推理比 GPU 慢 5–10 倍(7B 约 1–3 token/秒 vs A100 的 20–50),但月费 $6–15 而非 $100–300。对开发测试、文档分析、低并发(日千次请求)完全够。规则:8 vCPU 跑 7–8B 体感可用;单核性能看架构(Xeon Gold / AMD EPYC 优先,避开十年前的老架构)。RackNerd 促销款 2 核/2GB 约 $2.50/月是甜点入门,RackNerd 年付 $10 出头也能上;要更稳上 DMIT / 搬瓦工。
推荐配置
- 测试 / 个人:2 核/4GB/55G+ SSD,跑 7B(Mistral 7B 量化仅 7.3GB,编码任务比 Llama 7B 强)。月付 $6 级。
- 日常使用:4 核/8–12GB,跑 13B,响应快。Hetzner CPX41 级约 €15/月性价比突出。
- 重度 / 70B:8 核/32GB+,高阶档 $30–50/月;真要快上 GPU VPS($90–360/月)。
避坑要点
第一,别信"7B 只要 4GB"——那是 GPU 显存话术,CPU 机器要按内存公式算,留 2GB 开销。第二,开 swap 兜底:内存不够时 fallocate -l 16G /swapfile 建交换分区,避免大模型 crash。第三,存储留足 55GB+,否则大模型拉不下来。第四,上下文长度(num_ctx)别拉满,8192 够用,拉到 32k 内存直接爆。第五,先月付试水,确认模型响应速度能接受再年付。
常见问题 FAQ
问:4GB 内存能跑 Ollama 吗?答:勉强跑 Phi-3 / Llama 1B,大点的会 crash 或狂用 swap。问:一定要 GPU 吗?答:不用,CPU 够用只是慢;8 vCPU 跑 7–8B 体感可用。问:最划算方案?答:RackNerd 促销 2 核/2GB 试水,日常上 4 核/8GB+,重度上 GPU。
#Ollama #自托管大模型 #本地AI #VPS配置 #DeepSeek #Llama #Qwen #AI推理 #VPS推荐