2026 决策指南:本地模型 vs 云 API 成本对比——你的 VPS 跑 Ollama 何时才划算
2026-08-16 · DevCraft Studio
用真实 TCO(硬件摊销、电费、运维)与多档 token 用量,实测测算自托管 Ollama/vLLM 与 DeepSeek/OpenAI 云 API 的盈亏平衡点,并给出按用量做决策的清单。读完你能判断自己的 VPS 是否该自建推理。
延伸阅读
更多相关攻略推荐:【AI自托管 01】2026 隐私优先 AI 栈:数据不出 VPS 、【知识库自托管 02】2026 实测:VPS 自托管 Anythin、【知识库自托管 03】2026 实测:搬瓦工/RackNerd 上自、如何给 VPS 厂商做"信用评估":跑路、超售与售后风险排查手册、【知识库自托管 01】2026 企业/个人私有文档 RAG 问答选型。
先说结论:到底谁更划算
2026 年本地推理火得一塌糊涂,Ollama 在 7 月刚宣布完成 8800 万美元融资,月活开发者冲到 890 万,85% 的财富 500 强都在内部用上了开源模型。与此同时,API 价格被 DeepSeek 这种开源权重厂商压到了接近地板价——V4-Flash 输出只要 0.28 美元/百万 token。这意味着:过去那种“自家跑模型一定更省”的直觉,在 2026 年已经不成立了。
一句话结论:用量小就别折腾,用云 API 最省心;用量大(或数据不能出内网)就自建 GPU 推理,能省一大笔。真正的盈亏平衡点不在“模型好坏”,而在“每月 token 量”和“你愿不愿意当运维”。
真账本:自托管的真实 TCO
很多人算自托管成本只算显卡钱,这是最大的坑。完整的 TCO(总拥有成本)至少包括四块:
- 硬件摊销:一台 RTX 5090 工作站裸机约 7000 美元,按 36 个月摊销,每月约 194 美元。如果是租 GPU VPS,比如 Vultr 或 Contabo 的 A100/H100 实例,每月 900–2500 美元起步。
- 电费与散热:RTX 5090 整机待机到满载约 900W,按美国商业电价 0.14 美元/度、7×24 开机,电费约 91 美元/月;再加 1–2 张卡的散热 86–130 美元/月。苹果 M4 Max 这种能效高的方案只要 16–20 美元/月。
- 存储:模型库涨得飞快,GGUF 量化文件动辄几十 GB,建议留 2–4TB 高速 SSD,约 15 美元/月。
- 运维人工:小团队每月 2–4 小时打底,企业级要 1.5–2 个全职工程师(每人年成本 15–25 万美元)。这是隐藏最深的“税”。
以一个 50 人团队、跑 13B–70B 模型、用 7000 美元 RTX 5090 工作站的例子算总账:硬件摊销约 194 美元/月 + 电费散热约 180 美元/月 + 存储约 15 美元/月 + 工程时间约 200 美元/月,全包一年约 7100 美元。注意这还没算前六个月踩坑的“DevOps 税”——通常会有 1–2 次事故,每次消耗 3–5 个工程师日。
几个档位的用量测算(盈亏平衡点)
把 TCO 摊到每百万 token 上更直观。在 RTX 5090、50% 利用率下:
- 自托管 vLLM(Llama 3.1 8B):约 0.36 美元/百万输出 token,吞吐 480 tok/s。
- 自托管 Ollama(同卡同模型):约 0.93 美元/百万输出 token,吞吐 185 tok/s。
- DeepSeek V4-Flash 云 API:0.28 美元/百万输出 token。
- OpenAI GPT-5.4 mini:4.50 美元/百万输出 token。
- OpenAI GPT-5.4:15 美元/百万输出 token。
几个关键盈亏平衡点(实测经验值):
- 自托管 vLLM 对比“混合约 6.25 美元/百万”的 OpenAI 成本,约在 3560 万 token/月(GPU 利用率仅 2.9%)就打平,超过后省 71%–97%,硬件回本周期 4–8 个月。
- 对比 Ollama Cloud Pro 的 20 美元/月订阅,自托管的硬件摊销本身就接近 97 美元/月,只要你的用量塞得进云端套餐的 GPU 时长配额,云端反而更便宜。
- 对比激进的 DeepSeek V4-Flash,自托管要到 约 8 亿 token/月才反超。也就是说,普通小项目用 DeepSeek 比自己买卡划算得多。
换个口径:按日用量算,单台 RTX 4090 VPS 的盈亏平衡点大约在 每日 500–1000 万输入 token。低于每月 500–1000 万 token,运维的心力往往比省下的 API 费还贵;超过这条线,自建的杠杆才真正显现。
自托管 vs 云 API:2026 价格速查
主流旗舰模型的每百万 token 价格(2026 年公开价):
- DeepSeek V4-Flash:输入 0.14 / 输出 0.28 美元,且缓存命中输入可低至约 0.0036 美元(降 90%+)。
- DeepSeek-V3:输入 0.27 / 输出 1.10 美元。
- OpenAI GPT-5.4-mini:输入 0.75 / 输出 4.50 美元。
- OpenAI GPT-5.5:输入 5.00 / 输出 30.00 美元。
- Claude Opus 4.8:输入 5.00 / 输出 25.00 美元。
看出门道了吗:输出 token 永远比输入贵 2–5 倍,而输出量最难提前预估。所以预算阶段别只盯输入价。另一个真相是,70% 的日常流量(分类、抽取、简单问答)用预算模型就能办,质量不掉,成本能砍 60%–80%。
你的 VPS 能不能跑?白名单供应商怎么选
本地推理最吃 GPU。先说清楚:RackNerd、CloudCone、Bandwagon(搬瓦工)、ColoCrossing 这类高性价比 VPS 基本是 CPU 实例,不适合直接跑 7B 以上模型做生产,硬跑只能 CPU 卸载,吞吐从 47 tok/s 掉到个位数。但它们很适合做三件事:
- 做 反向代理 / API 网关:把你对 DeepSeek 或自建 vLLM 的调用统一收口、加鉴权、做限流。
- 做 面向国内用户的转发层:Bandwagon(搬瓦工)的 CN2 GIA 线路回国延迟低,拿来转发 API 很稳。
- 跑 CPU 量化的小模型做测试:比如 3B 以内的 GGUF,验证 prompt 和流程够用。
真正要上 GPU 推理,看 Vultr 和 Contabo:两者都提供 GPU 实例(从 RTX 到 A100/H100)。Vultr 的 RTX 4090 实例约 180–280 美元/月包月,按需 0.30–0.50 美元/小时;Contabo 的 GPU 线性价比也不错。预算有限可以先从 RTX 3090(约 130–200 美元/月)起步,这是 2026 年自托管性价比最高的卡。下单前建议蹲一下各家历史特价,RackNerd、CloudCone 经常有年付神机。
实测避坑清单
这些坑我(和很多同行)都踩过,列出来帮你省时间:
- 别把 Ollama 直接绑 0.0.0.0:默认只监听 localhost,但一堆教程让你设 OLLAMA_HOST=0.0.0.0,结果裸奔在公网、没有任何鉴权。务必放 Caddy/Nginx 后面加 basic auth 或 token 校验。vLLM 同理。
- 锁模型摘要别锁 tag:llama3.1:8b 上游重打 tag 会变行为。生产环境拉一次后按 SHA 引用,重启不会意外换模型。
- vLLM 冷启动会拖死弹性伸缩:模型加载要 60–90 秒,按需扩 GPU 实例要做好“热池”或接受扩容不即时。
- 别用 24GB 卡硬跑 70B:会被迫 CPU 卸载,吞吐从约 47 tok/s 掉到个位数,损失远超省下的显卡钱。
- 注意模型许可:商用前确认权重许可证(很多开源模型对商用有限制)。
一个最小的 Ollama 加固示例(放 Nginx 后):
# 仅监听内网,不要直接暴露
export OLLAMA_HOST=127.0.0.1:11434
ollama serve > /var/log/ollama.log 2>&1 &
# 用 nvidia-smi 看显存占用
$(nvidia-smi --query-gpu=memory.used,memory.total --format=csv)
# Caddy 反向代理加鉴权(片段)
# basicauth / {
# user $HASHED_PASS
# }
决策清单:什么情况该自建,什么情况用云
照着这张清单对号入座:
- 每月 token 量 低于 500–1000 万,且团队没有专职运维 → 直接用 DeepSeek / OpenAI API,把精力放业务上。
- 每月 token 量 超过 1 亿,或有合规要求(数据不能出内网)→ 自建 vLLM + GPU VPS(Vultr/Contabo),能省 5–10 倍。
- 只是个人开发、写代码、做原型、内部小工具(≤5 人)→ Ollama 本地跑,十分钟就能用,零基础设施成本。
- 要面向用户的高并发 API(≥10 并发)→ vLLM 连续批处理,吞吐是 Ollama 的十几倍。
- 预算紧张想先试水 → RackNerd / CloudCone / Bandwagon / ColoCrossing 的小机器做网关和转发,GPU 推理租用 Vultr/Contabo。
混合架构:先用云、再逐步切到自建的渐进路线
绝大多数团队不该“一步到位”上 GPU,也不该“永远”给云厂商交税。更稳的姿势是渐进迁移,用一层代理把两条路都接上:
- 第一阶段(验证期):纯云 API,用 LiteLLM 这类网关统一包一层 OpenAI 兼容接口。此时你的应用代码里只写 model 字段,不写死厂商。跑一个月,把真实 token 量、输入/输出比例、峰值并发记下来——这就是后面算账的硬数据。
- 第二阶段(试水期):把 70% 的简单流量(分类、抽取、摘要)路由到 DeepSeek V4-Flash 或 GPT 的 nano/mini 档,只对复杂任务用旗舰模型。这一步通常就能把 API 账单砍掉一半以上,且零运维。
- 第三阶段(自建期):当月量稳定突破 1 亿 token,且你已用 Ollama 在本地验证过模型效果,再租 Vultr/Contabo 的 GPU 实例上 vLLM,把高并发或敏感流量切过去。因为前面用了统一网关,应用代码几乎不用改,只是把 model 指向换成本地端点。
这样你永远保留“退回云端”的能力:GPU 不够就临时扩云,云太贵就把能搬的搬回本地。关键不是二选一,而是把切换成本压到最低。另外提醒一句,很多团队忽略了出口流量费:云 API 通常免 egress,而自建后你的服务对外提供推理,跨区回国的带宽在 Bandwagon/ColoCrossing 这类线路上要单独算,别只盯着 token。