Ollama AI系列(2):VPS上的AI推理与API应用
2026-08-15 · DevCraft Studio
想在 VPS 上私布 AI 推理(Llama/Mistral/Qwen)不被 API 账单绑架?拆解 7B/13B 内存磁盘需求、ARM 与 x86 的 token 速度差异,以及抢不到 Oracle 时 Contabo 大内存与 RackNerd 低价的务实平替。
延伸阅读
更多相关攻略推荐:Ollama AI系列(2):VPS上的AI推理与API应用、ARM / Ampere 席卷 VPS:性价比真香还是兼容陷阱?、【VPS 硬件选型指南 (内存 篇) 02】大内存 VPS 能干嘛?、2026 独立站 PCI-DSS 自查清单:SAQ A 还是 A-E、2026 大内存 VPS 怎么选:8G/16G/24G 档位的真实用。
为什么要在 VPS 上自己跑大模型
2026 年,调用 OpenAI、Anthropic 这些托管 API 按 token 计费,用量一大账单就失控。很多团队开始把开源模型搬到自己服务器上跑,而 Ollama 是把这件事变简单的标配工具。它把模型下载、量化、CPU/GPU 调度和 HTTP 接口都包进一个二进制里,几条命令就能在 VPS 上起一个私有 LLM 服务。
自己跑的理由很实在:第一是隐私,提示词和文档全留在自己服务器,不发第三方;第二是成本,没有按 token 付费,重负载时第三方 API 贵得离谱,自托管只花服务器资源;第三是离线,模型不依赖外部 API 的在线状态。对法律、医疗、金融这类不能把数据送出去的场景,本地跑不是可选项,是硬要求。这篇文章就帮你算清在 VPS 上跑 Ollama 的真实账:内存、磁盘、ARM 还是 x86、以及抢不到免费机时的付费平替。
先算账:内存是生死线
大模型是资源怪兽,最硬的约束是内存。模型必须整段装进内存;装不下时 Ollama 会自动把部分层卸载到磁盘,生成速度直接掉 5 到 10 倍——那就是「能跑」和「想摔键盘」的分界。
一个实用经验公式:4 位量化(Q4)下,每十亿参数大约占 0.6GB 内存,再加上几百 MB 给 KV 缓存和上下文。所以 7B 模型权重约 4-5GB,8GB 机器能勉强塞下但几乎没余量给系统,容易触发交换,实际舒服线是 16GB;13B 约 8-9GB 权重,至少要 16GB,想稳就 32GB;70B 仅权重就 40GB 以上,得 64GB 起步。一句话:买内存优先于买核数,内存不够一切白搭。
7B 与 13B 的真实需求
对绝大多数人的预算 VPS,现实上限就是 7B,勉强够到 13B。下面把硬指标列清楚(均按 Q4 量化)。
| 模型规模 | 磁盘占用 | 最低内存 | 舒服内存 | CPU 体感 |
|---|---|---|---|---|
| 3B 以下(Phi-3 mini 等) | 2-3GB | 4GB | 8GB | 快,适合试水 |
| 7B-8B(Llama3、Mistral、Qwen) | 4-5GB | 8GB | 16GB | 可用,5-15 tok/s |
| 13B-14B(Llama3 13B 等) | 8-9GB | 16GB | 32GB | 慢,1-3 tok/s 偏多 |
| 70B 及以上 | 40GB+ | 64GB | 128GB | 无 GPU 基本不可用 |
重点提醒:13B 在纯 CPU 上生成速度常常掉到每秒 1-2 个 token,也就是一个字一个字往外蹦,对话体验很差,只适合后台批处理。想交互流畅,没 GPU 就老老实实待在 7B-8B 区间。70B 别指望 CPU,得上 GPU 实例,那是另一个价位的预算。
量化是什么:用精度换内存
原始模型是 FP16 格式,7B 就要约 14GB。量化把每个权重压到更少位数,用一点点质量换大幅下降的内存占用。Ollama 常用的默认是 4 位(Q4_K_M),是 CPU 推理的甜点:7B 量化后只占 4-5GB 内存而非 14GB。还有 Q8 质量更好但占用翻倍,FP16 最准但最吃内存。
对 VPS 用户来说,结论很直接:没有 GPU 就老老实实用 Q4_K_M,质量损失对绝大多数任务可以忽略,内存和速度都最优。如果你内存宽裕到 32GB,可以上 Q8_0 提升一点回答质量。别一上来就追大模型,先用 3B 或 7B 把项目跑通,确实需要再升级。
ARM 还是 x86:token 速度的真相
很多人纠结要不要特意选 x86。结论先给:对 Ollama 这类 CPU 推理,同核数同频下 ARM 和 x86 的 token 速度接近,ARM 往往每 GB 内存更便宜 20%-30%,反而更划算。Ollama 底层是 llama.cpp,原生支持 ARM64(aarch64),会利用 ARM 的 NEON 指令做矩阵运算。
实测也有佐证:在同类规格下,ARM 实例比 x86 的 token 速度甚至能高 15% 左右;AWS Graviton5 对比同档 x86,吞吐高约 22%-27%,单价还便宜近 40%。所以除非你 VPS 上还有别的服务强制要求 x86,否则不必特意追 x86。注意一点:手动下模型文件时要选对应架构的量化,但用 ollama pull 会自动下载匹配你架构的版本,这点不用操心。
没有 GPU 也能跑,但 13B 已吃力
绝大多数便宜 VPS 没有 GPU,Ollama 完全支持纯 CPU 推理,只是慢。7B 在 CPU 上大约每秒 5-15 个 token,相当于每秒两三句话,对话和自动化任务都够用;13B 在 CPU 上掉到 1-3 tok/s,只适合后台批处理;70B 无 GPU 基本不可用。
如果响应速度重要且没 GPU,就待在 7B-14B。想快,得上有 NVIDIA 显卡的实例,速度能从 CPU 的个位数直接拉到 30-60 tok/s,但成本跳一档。对自托管项目,CPU 盒子在低价位就能把活干了的现实,是很多人忽略的甜点区。另外 CPU 核数有帮助但有边际递减:从 2 核到 4 核吞吐大约翻倍,再多到 12-16 核收益就摊平了。
真实命令:装 Ollama 跑模型
下面是在一台 Ubuntu/Debian VPS 上起 Ollama 的可复制步骤,没有 GPU 也能跑。
# SSH 进服务器
ssh root@你的VPS的IP
# 更新系统
apt update && apt upgrade -y
# 官方一键安装(自动识别架构与是否带 GPU)
curl -fsSL https://ollama.com/install.sh | sh
# 确认服务在跑
systemctl status ollama
# 拉一个 7B 模型(以 Qwen 为例,会自动选对应架构量化)
ollama pull qwen2.5:7b
# 进入交互对话(没拉会先拉再跑)
ollama run qwen2.5:7b
# 列出已装模型 / 删除模型腾磁盘
ollama list
ollama rm qwen2.5:7b
# 常驻 API 服务(默认监听 127.0.0.1:11434)
ollama serve
装完先 ollama run 跑个 hello world 验证能出字。模型文件默认存在 /usr/share/ollama/.ollama/models,磁盘紧张前先用 df -h 看空间。7B Q4 模型约 4-5GB,拉取需要稳定带宽,别在快没流量时硬拉。
安全:11434 端口别裸奔
Ollama 的 API 默认无鉴权。它默认绑 127.0.0.1:11434,但如果你的 VPS 没防火墙、或你手贱改成了 0.0.0.0,那任何人都能拉模型、跑推理、把你的磁盘和 CPU 吃满。所以暴露到公网前必须先做防护。
- 用 UFW 先封端口:只放 SSH(22)、HTTP(80)、HTTPS(443),绝不开放 11434 到公网。
- 反向代理加鉴权:用 Caddy 或 nginx 在 11434 前加 HTTPS 和基础认证,只允许你自己访问。
- 必要时才放行:如果只是自己用,保持 11434 仅本机,再用 SSH 隧道转发端口到本地即可。
顺序很重要:先配防火墙再启动 Ollama,避免一开机就被扫。公网裸奔的 Ollama 实例已经被大量滥用,别成为其中之一。
Oracle 抢不到?付费平替怎么选
理想情况是 Oracle Cloud 永久免费层:4 个 ARM 核、24GB 内存、200GB 硬盘,完全免费,跑 7B 甚至 13B 都够。问题是它经常「capacity 不足」,新账号按地区限流,免费机可能要等几天才 Provision 出来,能不能抢到全看运气。
抢不到时的务实平替,白名单里我们重点看两家:
- Contabo:大内存低价之王。8GB/200GB NVMe 约 $7/月,16GB 档也就十几刀,每美元给的内存狠,正好对症「Ollama 吃内存」的负载。坑是节点密集超售,晚高峰 CPU 被邻居抢,磁盘 IO 在低价档偏慢,网络一般,售后慢。适合 RAM 重、对单核性能不敏感的自托管推理。
- RackNerd:低价入门之王。年付十几刀的机器适合先练手、跑 3B 小模型或做轻量 API 端点,但共享 CPU 且 2GB 内存根本装不下有用模型,网络也不够稳。别指望在上面认真跑 7B,定位是「熟悉流程 + 超低价」。
如果预算宽松、要生产级稳定,Vultr 这类按小时、网络干净、有新加坡节点的商家更适合做常驻推理服务,虽然单价比 Contabo/RackNerd 高几倍,但省心。一句话:要内存选 Contabo,要低价练手选 RackNerd,要稳选 Vultr。
按预算选配置
直接给结论:
- 试水/学命令:RackNerd 或任意 1-2GB 小机,跑 1B-3B 模型(如 phi3、tinyllama),月成本几块到十几块。
- 个人 7B:4 核 / 8GB 起步,舒服线 4 核 / 16GB;Contabo 8GB 或 16GB 档合适,月十几到二十刀。
- 小团队 7B-13B API:4-8 核 / 16-32GB,32GB 是黄金标准,能上 Q8 提升质量;Contabo 16GB 档或 Vultr 中配。
- 30B-70B:需要 64GB+ 或 GPU 实例,超出普通便宜 VPS 范畴,建议上带显卡的独服,不在本文预算内。
另外三条铁律:NVMe 必选(机械盘让模型加载慢到崩溃);系统选 Ubuntu 24.04 LTS 最顺;挑包月/年付不限流量的方案,因为 7x24 跑着和空闲成本一样。
自己动手验证性能
机器到手,先确认它能跑、跑多快。两件事:
# 确认 CPU 支持 AVX2/AVX-512(x86 推理加速需要)
lscpu | grep Flags
# 拉 7B 后测实际生成速度
ollama run qwen2.5:7b "用一句话解释什么是 VPS"
看输出节奏估 token 速度:7B 在 16GB/4 核上应至少 10 tok/s 左右;若只有 2-3 tok/s,多半内存不足在交换或 CPU 太弱。再用 htop 看推理时内存占用,确认没触发 swap。ARM 机器用 lscpu 看是不是 aarch64,ollama pull 会自动拉对架构。把实测速度和本文表格对照,就知道这台机器适合跑多大模型。
结语
在 VPS 上用 Ollama 私布大模型,本质是算清一笔账:内存是生死线,7B 要 16GB 才舒服,13B 需 32GB 且 CPU 已吃力,70B 别想 CPU。ARM 和 x86 速度接近、ARM 更便宜,不必特意追 x86。没有 GPU 也能跑 7B 干不少活,只是别贪大。抢不到 Oracle 免费机时,Contabo 用大内存低价接住 RAM 重负载,RackNerd 用超低价让你先练手,Vultr 用稳定和网络换生产级安心。记住 11434 别裸奔、NVMe 必选、Ubuntu 24.04 最省心。把需求和预算对上号,你也能用几刀到几十刀的月费,摆脱 API 账单的绑架。