租 GPU 算力价格对比 2026:H100/A100/L4 每小时到底多少钱(2026)
2026-08-15 · DevCraft Studio
想跑大模型或 AI 绘画却算不清云端 GPU 账?本文横向对比 H100/A100/L4/4090 等主流卡的参数定位与各平台(Lambda/RunPod/Vast.ai/主流云)按小时报价,给出按需与预留、显存与性价比的选型建议。
延伸阅读
更多相关攻略推荐:618 年中大促 VPS 优惠:搬瓦工过不过 618?该买哪家、AI 算力荒如何推高你的 VPS 账单:内存、电力与连锁涨价、【AWS 免费 01】2026 AWS 免费套餐(Free Tier、【AWS免费 01】AWS 免费层隐藏扣费陷阱:2026 不花冤枉钱、2026 开发者最值得买的便宜 VPS 清单(附选购思路)。
一、为什么要先把 GPU 租赁的账算清楚
2026 年做 AI,最容易踩的坑不是模型选错,而是算力账没算明白。和买一张游戏显卡不同,数据中心级 GPU 的门槛高得离谱:一块 H100 公开渠道要价 2.5–4 万美元,A100 80GB 也要 1.5–2 万美元,即便消费级的 RTX 4090 全新也要 1600–2000 美元,还不算电源、主板、散热和电费。更麻烦的是硬件迭代快——Hopper 架构的 H100 还没完全回本,Blackwell 架构的 B200/H200 就已经铺货,三年前买的卡转眼就落伍。对绝大多数个人和小团队来说,一次性砸几万块买卡既不划算,也押错了技术路线。
正因如此,按小时租赁才成了主流选择:你不必承担折旧、缺货和电费,只要在需要时调用一台带 24GB 甚至 80GB 显存的机器,跑完即停。它特别适合三类场景——突发需求(周末集中出一批图、跑一段视频)、实验性工作(试一个新模型、换个量化精度)和临时的大显存(微调 70B 模型、做长上下文推理)。把"买硬件"变成"买服务时间",预算从资本支出(CapEx)变成了运营支出(OpEx),现金压力小得多。下面我们就把这张账拆开算。
二、主流显卡参数与定位:H100 训练旗舰、A100 经典、L4 节能、4090 性价比
选卡先看三件事:显存(决定能装下多大的模型)、带宽(决定推理和训练快慢)、功耗与价格(决定性价比)。2026 年最常被拿来比的有四张卡:
- H100(Hopper 架构,训练旗舰):80GB HBM3 显存,带宽 3.35TB/s,FP8 张量算力约 3958 TFLOPS(开启稀疏),TDP 高达 700W,NVLink 4.0 互联达 900GB/s。它的杀手锏是原生 FP8 与 Transformer Engine,能大幅压缩大模型训练与推理的耗时,是当前前沿训练和多卡集群的绝对主力,但价格也最贵。
- A100 80GB(Ampere 架构,经典干活卡):80GB HBM2e 显存,带宽 2.0TB/s,INT8 约 1248 TOPS(开启稀疏),TDP 400W,NVLink 600GB/s。它没有原生 FP8,算力约为 H100 的一半,但生态极其成熟、价格亲民,是 7B–34B 模型训练与 70B 量化推理的"万金油"。
- L4(Ada Lovelace 架构,推理节能卡):仅 24GB GDDR6 显存,带宽 300GB/s,FP8 约 485 TOPS,TDP 只有 72W,且是纯 PCIe 卡、没有 NVLink。它不适合训练,却是部署 7B–13B 对话模型、Stable Diffusion 出图、语音转写等推理负载的省钱首选——电费几乎可以忽略。
- RTX 4090(消费级,性价比之王):24GB GDDR6X 显存,带宽约 1TB/s,TDP 450W。它算力接近专业卡、价格却只有零头,是原型验证、小模型微调、AI 绘画和量化推理里性价比最高的"全能机",短板是显存上限 24GB、无法做多卡 NVLink 训练。
一句话定位:要训练大模型选 H100/H200,要稳又省钱选 A100,纯推理省钱选 L4,个人实验与绘画选 4090。显存往往是比算力更先撞到的天花板——装不下模型,算力再高也没用。
三、各平台按小时报价:Lambda / RunPod / Vast.ai / 主流云
下面是从各平台公开价目整理的大致区间(币种为美元/小时,价格随时波动,下单前务必复核;本表综合各源数据,采集时间集中在 2026 年 7–8 月)。
- Lambda Labs(自有数据中心,价稳):H100 约 2.49–2.99,A100 40GB 约 1.29、80GB 约 1.79–1.99,RTX 4090 约 0.50。附带最高 10TB 免费持久存储、无出网费,适合怕波动的研究者。
- RunPod 安全云(稳定可靠):H100 PCIe 约 2.89、SXM 约 2.99、H200 约 4.39;A100 PCIe 约 1.39、SXM 约 1.49;RTX 4090 约 0.69、RTX 5090 约 0.99、L40S 约 0.86、A5000 约 0.27。其社区云(P2P 容量)更便宜:H100 PCIe 约 2.39、A100 PCIe 约 1.19、4090 约 0.34、RTX 3090 约 0.22,但无 SLA、可能波动。
- Vast.ai(P2P 开放市场,最低价):H100 SXM 最低可到约 0.99(市场中位数约 2.13),H200 约 2.63,B200 约 3.75;A100 PCIe 约 0.67、SXM4 约 0.13 起;RTX 4090 约 0.13 起、RTX 3090 约 0.08、V100 约 0.03。价格最低但波动最大、实例默认可中断。
- 三大公有云(AWS / GCP / Azure,企业级溢价):AWS p5 的 8 卡 H100 实例折算单卡约 12.29,GCP A3 约 5.45,Azure 约 11–13;A100 在公有云约 5 美元/小时。L4 则便宜些:GCP G2 约 0.71、AWS G6 约 0.81、Vultr 约 0.50、RunPod 约 0.43–0.64。公有云比专业 GPU 云贵约 3–5 倍,但胜在和既有数据、托管服务、合规同处一地。
对照很直观:同一块 H100,专业云约 2.5–3 美元,Vast.ai 最低不到 1 美元,公有云却要到 5–12 美元。差距来自 NVLink 集群、InfiniBand 网络和 SLA,未必全是溢价。临时跑一下选专业云足矣;只有"必须和你的数据/服务待在一起"时才值得为公有云买单。
四、按需、抢占式与预留实例:三种计费模式怎么选
计费模式直接决定单价,2026 年的玩法主要有三种:
- 按需(On-demand):Lambda、RunPod 安全云这类明码标价、随开随停,按秒计费。价格稳定、有 SLA,适合生产推理和不容许中断的训练。代价是单价最高。
- 抢占式 / 现货(Spot / Community):Vast.ai 的全部实例、RunPod 社区云都属于这一类。价格比按需低 30–50%,但实例可能被随时收回。只要你的任务有断点续训、容错机制(训练写 checkpoint、推理用队列),它就是省钱利器。有源统计 Vast.ai 上选可靠性评分 ≥97% 的已验证主机,能把 8 小时内的中断率压到 3% 以下。
- 预留 / 包年(Reserved / Commit):AWS 的 Capacity Blocks 可锁定 1–14 天的 H100 容量;三年预留实例(RI)相比按需可便宜 35–50%。适合有长期稳定训练流水线的团队。唯一风险是:在 Blackwell 已经铺货的 2026 年,把三年赌在某一代卡上,技术折旧风险不小。
实战建议:实验与可中断任务用抢占式,正经训练与线上服务用按需或社区云,长期满载再谈预留。别一上来就买三年预留,先把利用率跑清楚。
五、显存与性价比:按 token 成本和出图成本算账
比单价还不够,真正该比的是"每单位产出多少钱"。两个常用算法:
- 按 token 算(推理):据 SemiAnalysis 2026 年 4 月的 InferenceX 基准,NVIDIA H100 跑 GPT-OSS-120B(用 vLLM)约 0.09 美元 / 百万 token;而新一代 B200 用 TensorRT-LLM 可做到约 0.02 美元 / 百万 token,便宜约 4.5 倍。也就是说,选对卡和框架,推理账单能直接砍掉一大截。
- 按出图算(AI 绘画):一张 24GB 的 RTX 4090 约 0.3–0.7 美元/小时,跑 SDXL/FLUX 量化版每小时能出几十到上百张图,单张成本往往不到一分钱;L4 虽然贵一点(0.4–0.8 美元/小时)但功耗仅 72W,长时间挂推理服务时电费优势明显。
- 按算力算(训练):A100 单价约为 H100 的一半,但 FP8 算力只有后者的一半不到。如果你的框架能充分利用 FP8 与 Transformer Engine,H100 的"每 TFLOPS 美元"反而可能更优;若只能跑 BF16,A100 的性价比更高。
结论:别只看每小时单价,要看"每百万 token"或"每张图"的真实成本。同样一笔推理预算,换张新卡、调个精度,可能省下一半。
六、租还是买:回本周期到底多长
很多人纠结"自建一台不更划算?"。用 2026 年的真实数据算回本周期(硬件价 + 电费 + 机箱,对比云上租金):
- RTX 4090(约 1600 美元):若每天 24/7 满载,约 1.3 年回本;若每月只用 160 小时,要近 5.9 年才回本——而这时显卡早该换代了。本地机另加约 0.12 美元/度的电费,24/7 一年电费就约 550 美元。
- A100 80GB(约 1.25 万美元):24/7 约 1.3 年回本,每月 160 小时则要近 5.7 年。对企业级卡来说,自建的门槛和折旧都太高。
- H100 80GB(约 2.5 万美元):即便 24/7 也要十几年才回本,几乎永远租更划算。
所以经验法则很清楚:每天只用几小时,坚决租;每天 24/7 满载且计划持有 3 年以上,才考虑自建 4090;A100/H100 这种企业级卡,别买,租。最受欢迎的是混合方案——本地放一两张 4090 做日常开发与实验,真要训练大模型或跑满血 70B 时再上云租 A100/H100,推理 API 用 RunPod 这类无服务器(serverless)按需伸缩。
七、按场景选型:训练 / 推理 / 绘画各用哪张卡
把上面的参数和价格落到具体场景:
- 大模型训练 / 微调 LoRA:首选 H100/H200 多卡 NVLink 集群(带宽 3.35–4.8TB/s、原生 FP8);预算有限就 A100 80GB 做量化训练。别用 L4 或 4090 做正经训练,带宽和互联都不够。
- 线上推理 API:7B–13B 模型用 L4(72W 极省电)或 4090;70B 量化模型用 A100 80GB;追求高吞吐低延迟的生产环境再上 H100。能用 serverless 就别常驻实例,空闲不花钱。
- AI 绘画 / 视频:24GB 是舒适门槛,4090 性价比最高,L4 适合长时间挂服务,FLUX 全精度或多 ControlNet 才需要上 A100。
- 学生 / 原型验证:RTX 3090(二手约 600 美元起,云上约 0.08–0.22 美元/小时)或 4090 足矣,把真金白银留给"跑得通之后的规模化"。
一个常被忽略的原则:别为了"看起来专业"去租 H100。若你的模型 24GB 显存就装得下,多花的每一美元都是浪费。先量清楚模型大小,再选卡。
八、避坑与省钱清单
- 别忽视存储与出网费:RunPod 持久卷约 0.05–0.10 美元/GB/月,存大检查点很快累积;Lambda、RunPod、Vast.ai 出网多免费,但公有云出网常收 0.09–0.12 美元/GB,权重频繁下载会被坑。
- 用比价 API 而非手动刷:GPU 云价格每周都变,有聚合 API 把 AWS、CoreWeave、Lambda、RunPod、Vast.ai 的价目拉成一张表,设个阈值告警,能捡到 40% 的降价。
- 选对卡、别过度配置:能装下模型的显存就是够用,4090 跑得动就别上 A100,A100 跑得动就别上 H100。
- 用秒级计费的平台:RunPod、Vast.ai 按秒/分计费,一个 40 分钟的任务就只付 40 分钟;别选按小时起算、最低计费 1 小时的商家。
- 每月复核一次行情:2026 年 GPU 云价格波动剧烈,长期任务每隔一段时间比一次价,迁移到更便宜的平台可能省下大笔开销。
#GPU租赁 #云算力性价比 #H100 #A100 #AI推理