2026 按小时 GPU 成本横评:H100 / A100 / A4000 哪家 VPS 最划算?
2026-08-16 · DevCraft Studio
2026 年 GPU 按小时租用价格剧烈分化:AWS 的 H100 高达每小时 12 美元,而新算力云只要 1.4 美元。本文横评 H100、A100、A4000、L40S、RTX 4090 在主流 VPS 与云平台上的每小时价格、显存与性价比,并给出文生图、推理、训练的选型矩阵和省钱策略。
延伸阅读
更多相关攻略推荐:独服、裸金属、VPS 到底差在哪:什么时候该升级、【VPS 硬件选型指南 (存储 篇) 04】不同业务场景的磁盘体感与、【跑分解读 01】别被商家的虚假宣传骗了!VPS 性能跑分全指南:Y、【VPS 进阶玩法精选 022】VPS 计费门道:预付、按比例、发票、2026 VPS 选购决策树与白皮书:一张图看懂怎么买。
先说结论:2026 年别再闭眼买大厂的 H100
如果你正在为文生图、模型推理或训练选 GPU,先把一句话记牢:2026 年同样的 H100 80GB 单卡,AWS 按需每小时约 6.9 到 12.3 美元,而 RunPod、Vast.ai、Thunder Compute 这类新算力云只要 1.4 到 3 美元。价格差接近 4 到 8 倍,而芯片是同一块硅。对中小型团队和个人开发者来说,这意味着每月账单可能差出几千美元。
但便宜不等于无脑冲。市场被分成了几个层级:超大规模云(AWS、GCP、Azure、Oracle)卖的是合规、SLA 和全球网络;新算力云(RunPod、Lambda Labs、Vast.ai、CoreWeave、Together AI、Nebius)卖的是价格和机器学习体验;Vultr 这种传统 VPS 厂商则用更可预期的账单和全球节点切入。下面我们把实测典型价格摊开讲。
2026 年价格为什么会分化这么厉害
很多读者第一反应是:同样一块 H100,凭什么差价能到 8 倍?根子在于“你买的不是芯片,是一整套服务”。超大规模云把合规资质、跨区专线、企业级支持、托管存储和安全审计都打包进了单价,而这些对大多数 AI 工作负载并不是刚需。新算力云砍掉了这套臃肿的中间层,只卖裸算力和最起码的镜像环境,价格自然腰斩再腰斩。
另一个推手是供给结构变了。2026 年专业算力云(neocloud)囤了大量 H100、H200 和 A100,靠薄利多销抢客户;而超大规模云把高端卡优先留给自家大模型训练和长期合约客户,零售配额紧、价格硬。再加上实时比价 API 和价格追踪站点的出现,买家第一次能像比价机票一样比 GPU,信息透明把溢价一点点挤掉了。所以结论很朴素:除非你的业务真的依赖大厂的合规和网络,否则把 GPU 需求挪到新算力云,是 2026 年最划算的一次迁移。
2026 各家 GPU 每小时价格实测横评
下面这张表是把多个 2026 年价格快照归一化到“单卡每小时美元”后的典型区间。市场波动很大,Vast.ai 这类集市价格每天浮动,所以凡是不确定的我都标了“约”。RTX A4000、RTX 4090 这类消费卡在超大规模云上基本买不到单卡,所以对应格留空。
GPU 显存 Vultr Lambda RunPod Vast.ai AWS GCP Azure 典型最低
RTX A4000 16GB - - $0.25 $0.17 - - - ~$0.17
RTX 4090 24GB $0.50 $0.50 $0.34 $0.27 - - - ~$0.27
L40S 48GB - - $0.79 $0.60 - - - ~$0.60
A100 80GB 80GB $0.62 $1.29 $1.39 $1.89 ~$5.26 ~$4.05 ~$5.00 ~$0.62
H100 80GB 80GB $2.99 $2.49 $1.99 $1.38 ~$6.88 ~$9.00 ~$12.29 ~$1.38
几个关键观察:
- A100 是性价比之王:Vultr 的 A100 80GB 按需只要 0.62 美元/小时,是整套表里最便宜的“数据中心级大显存”选项。如果你的模型能塞进 80GB,A100 比 H100 省一大半。
- H100 的价格断层最夸张:超大规模云单卡 6.9 到 12.3 美元,新算力云 1.4 到 3 美元。除非你要的是大厂的合规和网络,否则没必要为同款芯片多付 4 倍。
- 消费卡最便宜:RTX 4090 最低 0.27 美元/小时,RTX A4000 最低 0.17 美元/小时。它们显存小(16 到 24GB),但做文生图、量化推理绰绰有余。
- L40S 是被低估的推理卡:48GB 显存、数据中心定位,价格却只有 H100 的零头,对 7B 到 70B 模型的服务场景非常友好。
显存和性价比到底怎么看
选 GPU 不能只看每小时单价,更要看“显存够不够”和“每美元能跑多少活”。一个简单心法:先按模型大小卡显存下限,再在满足下限的卡里挑最便宜的。
- 7B 到 13B 模型:量化后 4 到 14GB 显存,RTX 4090(24GB)或 A4000(16GB)足够,单价最低。
- 30B 到 70B 量化模型:需要 24 到 48GB,L40S(48GB)或 A100 40GB 是甜点区。
- 70B 全精度 / 训练 / 多卡并行:贴着 80GB 显存上限,A100 80GB 或 H100 80GB 才稳。
- 文生图(SDXL、Flux 等):16 到 24GB 显存就能跑,消费卡性价比最高。
实测里还有个反直觉的点:H100 的吞吐大约是 A100 的 1.8 到 2 倍(以 Llama 类任务计),但价格只差 1.5 到 2 倍。所以对“吞吐敏感、跑得满”的训练任务,H100 的单位产出反而可能更划算;对“跑不满、零星用”的开发任务,A100 才是省钱答案。
文生图 / 推理 / 训练 选型矩阵
把上面拆开,给你一张可以直接照抄的选型矩阵。
场景 推荐 GPU 典型单价 备注
文生图(SDXL) RTX 4090 / A4000 $0.27-0.50 16-24GB 够用,消费卡最香
轻量推理(7-13B) RTX 4090 $0.27-0.50 量化后显存宽松
中等推理(30-70B) L40S / A100 40G $0.6-1.3 48GB 是甜点
高吞吐推理(70B+) A100 80GB $0.62-1.9 Vultr 低至 0.62
微调/训练 A100 80GB $0.62-2.8 多卡用 Lambda 集群
极限训练(H100) H100 80GB $1.4-3.0 新算力云,别碰大厂
注意“典型单价”是按需价,spot(抢占式)还能再砍 20% 到 60%。如果你做的是批量文生图、离线摘要这类能容忍中断的活,直接选 spot。
省钱策略:spot、休眠、预留
账单控制有三把刀,按优先级排:
第一刀:用 spot 抢占式实例
RunPod 社区云的 H100 spot 约 1.25 美元/小时,比按需 1.99 便宜近四成;Vast.ai 的 spot 常常不到 1 美元。代价是可能被回收,所以只适合可重跑的批处理,不适合对外服务的在线推理。
第二刀:休眠 / 缩到零
很多账单是被“空转”吃掉的。开发机不用就关机,推理用 RunPod 的 Serverless(FlashBoot 冷启动号称亚 2 秒)或 Vultr 的弹性方案,空闲时不计费。一个常见坑:有人开了一台 H100 跑了一整周却只用了 5 小时,剩下 163 小时都在烧钱。把“用完即停”写进脚本。
第三刀:预留 / 包月
Lambda Labs、Together AI、CoreWeave 的预留实例比按需便宜 30% 到 60%。缺点是通常要绑 1 到 3 个月、有最低承诺。只有当你确认要连续跑满一个月以上,预留才划算。短期、波动大的需求,宁可走 spot + 休眠。
还有两个隐藏成本:出网流量费和存储费。AWS、GCP 出网约 0.09 到 0.12 美元/GB,大量产出图片或视频时这块能占总支出 10% 到 30%;RunPod Serverless、Fluence 这类零出网方案对文生图很友好。存储按 0.07 到 0.18 美元/GB/月算,记得清理 checkpoint。
几个常见平台的现实情况
结合本次横评,把 vultr、contabo、dmit 这几个在中文圈常被拿来比价的厂商也放进来聊几句,方便你做整体架构。
- Vultr:GPU 产品线定价清晰,A100 80GB 低至 0.62 美元/小时,RTX 4090 约 0.5 美元/小时,按秒计费、全球节点多、账单可预期。适合想要“传统云体验 + 稳定 GPU”的团队,尤其做 Mistral-7B 这类小模型推理时单卡性价比很高。缺点是大显存 H100 供给相对少,价格也比最便宜的集市略高。
- Contabo:以欧洲低价 VPS 出名,也提供带 GPU(如 RTX 系列、部分 A100)的实例,欧洲区价格有竞争力,适合预算敏感、主要服务欧洲用户的项目。坑点是 GPU 型号和库存不如专业算力云透明,抢手卡常售罄,下单前务必确认显存和具体型号。
- DMIT:以亚太低延迟、网络质量稳定著称,但本身不是 GPU 算力厂商。更现实的用法是把 DMIT 当控制面 / API 网关 / 中转节点,GPU 重活外包给 RunPod、Vast.ai 或 Vultr,这样亚太用户访问延迟低,又不用为 GPU 空转付高价。
实测避坑清单
- 别只看贴牌价:单卡价往往不含 vCPU、内存、存储和出网费。一套完整实例的“真实单价”可能比贴牌高 30% 到 80%。
- 注意最小计费单位:有的是按秒(RunPod、Vultr),有的是按小时。按小时计费下,哪怕只用 10 分钟也扣整小时。
- H100 经常缺货:Lambda Labs 的 H100 热门时段要排队数小时,集市价格波动大。非必须就上 A100。
- 量化能救显存:4-bit / 8-bit 量化让 70B 模型塞进一张 4090,吞吐反而更高、单 token 成本更低,质量下降通常人眼难辨。
- 别在超大规模云跑开发:nops 的测算显示,GPU 利用率只有 5% 时,AWS H100 的“有效每小时成本”会被空转放大到约 245 美元。开发测试请用便宜算力云或本地。
给不同预算的一句选型建议
如果你只想要一句话带走:预算紧、做文生图或量化推理,闭眼选 RTX 4090(约 0.27 美元/小时),显存不够再上 L40S;要跑 70B 级别服务或微调,A100 80GB(Vultr 低至 0.62)是甜点;只有吞吐拉满的大模型训练才值得碰 H100,而且一定走新算力云的 1.4 到 3 美元区间,千万别回大厂挨 12 美元的刀。把 spot 和休眠写进工作流,账单通常能再砍一半。