【GPU VPS 02】普通 VPS 能用上 GPU 吗?GPU 直通与低价 GPU VPS 选型 2026
2026-08-15 · DevCraft Studio
普通 VPS 一般没有 GPU,要靠云厂商的 GPU 实例或 GPU Pod。本文讲清 GPU 直通(IOMMU+VFIO)原理、Ollama 跑 7B/14B 模型的显存门槛、2026 年各档 GPU 价位,以及低价 GPU VPS 的计费粒度、存储、流量等隐藏坑。
GPU VPS 系列 · 共 4 篇
本篇是 GPU VPS 系列的第 2 篇,聚焦「直通与选型」——讲清 GPU 直通(IOMMU + VFIO)原理、普通 VPS 怎么用上 GPU,以及各模型显存门槛。如果你更关心「H100 / A100 / L4 价格横评」,请回看第 1 篇;想了解「跑 Stable Diffusion 要什么显卡」或「云端出图工作流怎么搭」,请跳到第 3、4 篇。
最近想折腾 AI 的人基本都问过同一个问题:我这台 VPS 能不能跑大模型?答案是——绝大多数普通 VPS(不管是共享还是独立 vCPU)压根没显卡,你 SSH 进去敲 nvidia-smi 只会得到"命令找不到"。想用 GPU,得专门开带 GPU 的实例,或者去 GPU Pod 平台。这篇就把"普通 VPS 怎么用上 GPU"这件事的底层原理、选型价位和那些容易多花冤枉钱的坑,一次讲透。
延伸阅读
更多相关攻略推荐:【VPS 硬件选型指南 (CPU 篇) 04】AMD EPYC 还是、【VPS 进阶玩法精选 014】ARM 架构 VPS 值不值得上?A、【对象存储 01】对象存储怎么选:Backblaze B2 vs C、【内存技术 01】DDR4 还是 DDR5?2026 年内存涨价背景、独服、裸金属、VPS 到底差在哪:什么时候该升级。
GPU 直通(Passthrough)到底是什么
你听到的"GPU 直通",专业叫 PCIe passthrough,技术栈是 IOMMU + VFIO + KVM/QEMU。说人话就是:把一块物理显卡从宿主机"摘"下来,独占、永久地分配给某一台虚拟机,这台 VM 像在物理机上直接插了卡一样访问硬件。
- IOMMU:硬件级内存隔离(Intel 叫 VT-d,AMD 叫 AMD-Vi),做 DMA 重映射,防止设备越权访问内存,是直通安全的前提;
- VFIO:Linux 内核框架,把 PCI 设备(显卡)从宿主机驱动解绑,暴露给用户态的 QEMU / KVM;
- 流程:BIOS 开 IOMMU → 内核参数加
intel_iommu=on iommu=pt(Intel)或amd_iommu=on iommu=pt(AMD)→ 把显卡绑到vfio-pci→ 在 libvirt XML 里用<hostdev>挂给 VM → VM 内装 NVIDIA 驱动。
重点是性能:KVM + VFIO 对计算负载通常能到 98%+ 原生性能(实测 A100 80GB 跑 PyTorch ResNet-50 训练 98.3%,CUDA 带宽 99.1%;T4 / TensorRT 推理延迟全批次偏差小于 1%)。开销只来自 IOMMU 地址转换的固定小成本,对 GPU 密集型几乎不可见。所以你平时用的云 GPU 实例,本质就是厂商在宿主机上用这套技术把卡分给你——你一般不用自己配。
和普通"虚拟显卡"的区别
直通是"整块卡给你一个人",性能好但卡不能共享,整合比最低、单 VM 成本最高。对应的还有 vGPU:NVIDIA 用时间片或 MIG 把单卡分给多台 VM(A100 / H100 支持 MIG 切分,T4 / L40S 支持时间片),适合 VDI、推理服务。另外还有 API 转发(比如把 CUDA 调用通过网络转给另一台有卡机器),性能损耗更大。普通云 GPU 实例大多走直通或 MIG,所以你拿到的是接近原生的算力。
一个消费级显卡的坑要提醒:NVIDIA GeForce / AMD Radeon 在虚拟化里驱动可能检测到 VM 并禁用功能(165 代及更早需要 VBIOS 透传,笔记本还要 spoof 电池,Pascal 及更早更复杂)。企业级 Tesla / Instinct 设计就支持虚拟化,是直通的"首选公民"。所以你租到的云 GPU 基本都是数据中心级卡,省去了这些破事。
普通人用上 GPU 的四条路
- 路径 A:云 GPU 实例(最省事)。直接开一台带 GPU 的云服务器 / Pod,SSH 进去跑 Ollama / ComfyUI。Vultr、RunPod、Lambda、Vast.ai、Paperspace、CoreWeave 都提供。白名单内的 Vultr 把 GPU 当普通云服务器附加,给完整 OS + SSH + 块存储 + 防火墙,AI 负载和你的 Web / DB / API 能在同一套基础设施里统一计费。
- 路径 B:Ollama 本地 / 云端推理。一条命令
ollama run llama3.2即可,自动下模型、量化、推理,不用配 Python / CUDA。GPU 加速比 CPU 快 10–50 倍。验证 GPU 用nvidia-smi,Ollama 会自动调用。 - 路径 C:Stable Diffusion / ComfyUI。SDXL 或更小模型单张 L4 就够;出图用 ComfyUI / Automatic1111 镜像。
- 路径 D:Serverless GPU(RunPod / Modal)。按秒计费、空闲缩到 0,适合突发推理,不用时为 0 成本。
显存是硬约束:各模型要多少显存
推理时模型权重常驻显存,一旦溢出到内存,速度会骤降(从 50+ tok/s 掉到个位数)。经验公式:模型大小 + KV cache + 10%–25% 余量 = 最小显存。Q4 量化下(8K 上下文)大致是:
- 7B(Llama3.1-8B / Qwen2.5-7B):约 4–6 GB → 8GB 显存就能跑;
- 14B(Qwen2.5-14B):约 10–11 GB → 12GB;
- 32B(Qwen3-32B):约 22 GB → 24GB;
- 70B(Llama3.1-70B):约 47 GB → 48GB+(单张 4090 的 24GB 放不下,需双卡或 A100 / H100)。
推荐起点:Ollama 7B / 8B 量化建议 16–24GB 显存 + 4 vCPU / 16GB 内存 + 80GB NVMe(RTX 4000 / L4 / 3090 / 4090);14B / 32B 量化要 24–48GB(4090 / A6000 / A40 / L40S);ComfyUI / SDXL 要 16–24GB;LoRA 微调 24–48GB;多用户推理 API 要 48–80GB(L40S / A100 / H100)。
别只买 8GB 显存:小模型 / 低分辨率能跑,但加长上下文、ControlNet、放大、并发后极易 CUDA OOM。16GB 是最低合理线,24GB 是个人甜点位。
跑 Ollama 7B 需要什么配置
最低门槛:8GB 显存 + 4 vCPU + 16GB 内存(7B Q4 约 4–6GB,8GB 卡够用)。更稳的配置是 16–24GB 显存,能跑 14B、长上下文、多并发。落地非常简单:
- 装 Ollama:
curl -fsSL https://ollama.com/install.sh | sh; - 跑模型:
ollama run llama3.2; - 确认用上 GPU:
nvidia-smi。GPU 比 CPU 快 10–50 倍。
生产环境建议:Ollama 的 API 只监听内网 / 本机,再经 Caddy / Nginx 提供 HTTPS、鉴权和限流,别把 11434 端口裸奔到公网。
没有 GPU 的 VPS 能跑大模型吗
能,但慢。CPU-only 跑 7B 大约 10–15 tok/s(需要 4+ 核、8GB+ 内存,且 CPU 支持 AVX2),适合个人测试 / 低频使用;生产或 14B 以上建议上 GPU。也可以走云端 serverless(RunPod / Modal)按秒付费,空闲缩到 0,把"没有卡"的短板用"按需租卡"补上。
2026 年 GPU 价位速记
价格 2026 年波动很大,下单前务必复核官网。大致档位(按美元 / GPU / 小时,按需):
- 入门 / 试水:RTX 4090 24GB 约 $0.34–0.44/hr,二手 3090 自购约 $680–800;
- 性价比推理主力:L4 24GB 约 $0.43–0.81/hr(Vultr 约 $0.50/hr);L40S 48GB 约 $0.49–1.67/hr;
- 中大模型 / 微调:A100 80GB 约 $1.19–1.50/hr(Vultr 约 $1.50/hr);
- 生产 / 前沿:H100 80GB 约 $2.49–3.49/hr(Vultr 约 $2.99/hr);H200 / B200 更贵。
注意跨厂商价差能到 3–5 倍:同款 H100,hyperscaler(AWS / GCP / Azure)往往比专业厂(Lambda / RunPod / CoreWeave)贵 3–5 倍,部分是 8x SXM + InfiniBand 真更贵,部分纯溢价。自己管训练网络选专业厂;贴近现有托管数据则留 hyperscaler。
买卡还是租云:回本账
RTX 4090(24GB,零售 $1,500–2,500):云上约 $0.39–0.44/hr。自建整机首年约 $4,424,而云上 160hr/月 仅约 $749/年。盈亏平衡:24/7 用约 1.3 年;每天 16hr 约 7.5 个月;每天 8hr 约 5.9 年。结论:只有 24/7 高利用率才值得买。H100 80GB(买约 $25,000–35,000)云上 $2.49–3.99/hr,24/7 也要约 10.5 个月才回本且一代可能过期,数据中心级卡几乎不值得自购,租更划算。
决策框架:买,当且仅当——每天 >6hr、需求 18 个月内不变、有空间 / 供电 / 散热、能接受折腾驱动;否则任一项不满足就租云。最成熟的团队普遍是混合策略:本地 1–2 张 4090 做日常开发 + 云上 A100 / H100 跑大模型训练 / 突发。
先想清楚要跑什么:按任务倒推显卡
很多人一上来就问"哪张卡最强",其实应该反过来——先看你到底要干什么,再倒推需要什么卡,能省一大笔钱。给你一个最短决策链:
- 只想本地聊天 / 写文案 / 跑 7B 小模型:8GB 显存勉强能跑,但如前所述 16GB 才舒服,这类需求一台 RTX 4090 或者云端 L4 实例完全够,别碰 A100 / H100,那是杀鸡用牛刀;
- 要出图(SDXL / 二次元模型 / ControlNet):单张 L4(24GB)或 4090 是甜点位,显存越大能开的重绘尺寸和插件越多;
- 要微调自己的模型(LoRA / QLoRA):24–48GB 起步,4090 / A6000 / A40 / L40S 这一档,低于 24GB 基本跑不动像样的微调;
- 要训中大型模型或做多用户推理服务:直接上 A100 80GB / H100 / H200,单卡 48GB 以下别想,而且这类基本只租云,自己买卡回本周期太长。
还有一个被忽略的点:显存不够时,量化(Q4 / Q5)是救命绳。同一模型用 Q4 量化显存能砍掉一半多,代价是效果略降、偶有胡说,但对多数个人场景完全可接受。所以"买不起大显存卡"不等于"跑不了大模型",先量化再上云,是性价比最高的起步姿势。
低价 GPU VPS 的坑
- 计费粒度:按小时实例忘了关机,H100 24/7 一个月约 $2,110;按秒实例(Vast.ai / RunPod / Lambda)更省短任务。常见错误:租 H100 却只需要 4090(6 倍溢价白花);按小时租却 24/7 用(改月付约 300–650 hr/月 是拐点)。
- 存储费:持久卷另计费,停了的 Pod 卷仍计费(RunPod 约 $0.20/GB/月)。70B 权重常驻,存储成本别忽略。
- 出站流量:部分厂商 $0.09–0.12/GB,拉 100GB 权重要算钱(RunPod / Vultr 有免费额度)。
- 显存陷阱:8GB 卡跑长上下文 / ControlNet / 并发易 OOM,起步选 16–24GB。
- 社区云 vs 安全云:社区云便宜约一半但稳定性 / 合规弱,生产用安全云或专用。
- 价格变动快:2026 年 5–7 月多厂商调价,下单前复核官网。
💡 延伸阅读:关于架构与基础设施的更多深潜指南,请前往 VPS 主题导读中心 (Hub) 获取全盘策略。