【GPU VPS 03】在 VPS 上跑 Stable Diffusion 出图:显卡要求与便宜 GPU 方案

想在 VPS 上跑 Stable Diffusion 出图,关键不是 CPU 而是显卡显存。本文讲清 SD1.5、SDXL、FLUX 各模型显存门槛,对比 T4、RTX 3090、4090、A100 等显卡,并给出 Vast.ai/RunPod 等便宜 GPU 云的租赁方案与省显存参数。

本篇是 GPU VPS 系列的第 3 篇,聚焦「显存与选卡」——讲清 SD1.5 / SDXL / FLUX 的显存门槛、各档显卡对照和软件栈。如果你更关心「H100 / A100 / L4 价格横评」或「普通 VPS 怎么用上 GPU」,请回看第 1、2 篇;想了解「云端出图工作流怎么搭」,请跳到第 4 篇。

你点开这篇文章,大概率是在找一台便宜 VPS 来跑 Stable Diffusion 出图。先泼一盆冷水:市面上绝大多数几美元一个月的 VPS,卖的只是 CPU、内存和硬盘,里面根本没有独立显卡。而 Stable Diffusion 这类扩散模型(diffusion model)每一步去噪(denoising)都是海量的矩阵乘法,必须由 GPU 的 CUDA 核心来算,CPU 顶多负责加载模型和预处理提示词。所以"在 VPS 上跑 AI 画图"的真正含义是:租一台带独立 GPU 的云实例——社区有时候叫 GPU 云、GPU 实例,本质就是一台插了游戏卡或数据中心卡的远程机器。本文就帮你把"到底要多少显存、选哪张卡、去哪租最便宜"这三件事讲透。

延伸阅读

更多相关攻略推荐:Ollama AI系列(2):VPS上的AI推理与API应用Ollama AI系列(2):VPS上的AI推理与API应用【CPU选型 01】搭载 AMD Ryzen 9950X 的 VPSARM / Ampere 席卷 VPS:性价比真香还是兼容陷阱?Ollama AI系列(2):VPS上的AI推理与API应用

一、为什么在 VPS 上跑 Stable Diffusion 要先谈显卡

普通 VPS 的算力来自 CPU,而扩散模型的推理是高度并行的张量运算,CPU 即使有二三十个核心也跑不过一张入门级显卡。实测里,一张 RTX 4090 出一张 1024x1024 的 SDXL 图只要几秒,而纯 CPU 跑同样一步可能要几十秒甚至更久,出一张图动辄几分钟到几十分钟,还非常吃内存。换句话说,没有 GPU 的 VPS 基本不具备"实用出图"的能力,只有带独显的实例才谈得上效率。这也是为什么本文通篇在讲显存和显卡型号,而不是在讲几核几 G 的 CPU。

二、显存(VRAM)才是命门:各模型到底要吃多少

跑 Stable Diffusion,显存容量比显卡算力更重要。模型权重、推理时的激活值、以及批处理都要整块塞进显存;一旦放不下,要么直接报错显存不足(OOM),要么被逼着把计算搬到系统内存,速度瞬间掉几个数量级。社区里公认的最低/舒适门槛大致是这样:SD1.5 在 512x512 下最低 4GB 显存(要开优化),6-8GB 才舒服、能跑图生图和大批次;SDXL 在 1024x1024 下最低 8GB(且要激进优化),12GB 是公认的甜点档,16GB 以上才能顺畅叠加 ControlNet、多个 LoRA 和 refiner;更新的 FLUX.1 模型要 12GB 起步,想要舒适出图最好 24GB。

一个很反直觉的事实是:8GB 显存"能跑"但处处是坑。社区实测,在 8GB 卡上用 AUTOMATIC1111 出一张 1024x1024 的 SDXL(含 refiner)大约 30 秒,但一旦加 ControlNet 或多 LoRA 就频繁 OOM;而 6GB 卡跑同样任务可能要接近一小时。到了 12GB,出图缩到约 20 秒,才算真正"不用做取舍";24GB 卡则能直接做 LoRA 训练。所以选卡的第一原则:优先堆显存,而不是看核心频率。

三、主流显卡对照:从 T4 到 RTX 4090、A100、H100

云上常见的显卡,按显存和定位可以排成一队。NVIDIA T4(16GB)是很多云厂商最便宜的入门卡,按小时租最便宜,但算力弱、出图慢,适合开发和偶尔试用;RTX 3060 12GB 是本地性价比之王,二手卡常在两百美元上下,12GB 刚好够 SDXL 基础玩法;RTX 4060 Ti 16GB 是新架构、功耗低,约四百多美元;RTX 3090 24GB 是 AI 社区的"神卡",二手约七百美元,24GB 几乎通吃当前所有模型;RTX 4090 24GB 是消费级旗舰,SDXL 出图快到每秒数张;专业卡如 RTX A4000 16GB、A5000 24GB 稳定性更好;数据中心卡 L4 24GB 适合长期跑服务;再往上就是训练级的 A100(40/80GB)和 H100 80GB,价格按小时算要贵一个数量级,普通出图其实用不上。

AMD 显卡(如 RX 7900 XTX 24GB)在 ROCm 支持下也能跑,但 NVIDIA 的 CUDA + PyTorch 生态成熟得多,xformers、各种插件开箱即用,新手强烈建议优先 N 卡,少踩坑。对于只想在 VPS 上出图的人,结论很直接:预算紧就奔 12GB 档(3060/4060 Ti),想省心就上 24GB 档(3090/4090/A4000/L4)。

四、没有 GPU 的普通 VPS 能跑吗?CPU 与内存的角色

如果你手头只有普通的 CPU 型 VPS,诚实地说:别指望本地出图。你可以走两条路:一是改用官方 API(如 Stability AI 平台、Replicate),把提示词发过去、人家在云端显卡上算完返回图片,好处是零硬件投入,坏处是按张计费、且模型控制权在别人手里;二是对本地卡做极度优化,比如把模型用 CPU 卸载(--lowvram / --medvram),但速度会慢 10 到 100 倍,基本只适合"验证能跑通"而非真正生产。

那么 CPU 和内存还重要吗?重要,但角色不同。CPU 几乎不影响出图速度,只影响模型加载、提示词编码(CLIP)等预处理,所以云实例给个 4 核以上的现代 CPU 就够;系统内存(RAM)建议 16GB 起步、SDXL 场景 32GB 更稳,因为权重会先映射到内存再进显存,太小会拖慢启动甚至崩。磁盘方面,装好环境加依赖大约要 20-50GB,模型权重另算:SD1.5 的 safetensors 约 2GB,SDXL base 约 6.9GB、refiner 约 6GB,FLUX 约 12-24GB,单个 LoRA 几十到几百 MB。所以一块 100GB 起的 NVMe 系统盘比较从容,模型多了再挂数据盘。

五、软件栈怎么选:Automatic1111、ComfyUI、Forge 与 InvokeAI

拿到带显卡的实例后,第一件事是装出图软件。AUTOMATIC1111 WebUI 是最老牌的图形界面,插件生态极其丰富,新手最友好,端口默认 7860;缺点是在 8GB 小显存卡上容易 OOM。ComfyUI 是节点式工作流,对 SDXL 的两阶段 base+refiner 管线支持更好,也更省显存,适合想精细控制出图流程的人,端口默认 8188。Forge 是 A1111 的一个分支,重写了后端,显存利用和速度都更好,能直接沿用大量 A1111 插件。InvokeAI 则是另一套独立实现。对于绝大多数想在 VPS 上出图的人,推荐 ComfyUI(省显存、管线灵活)或 Forge(插件多、上手快)二选一。

六、省显存与提速的硬核参数

同样的卡,参数调对了能多塞一个 LoRA,调错了直接 OOM。最常用的一招是开启 xformers( memory-efficient attention ),能省下 30% 到 50% 显存、同时提速 20% 到 40%,在 A1111 里加 --xformers 即可,ComfyUI 配合新版 PyTorch 多自动启用。显存实在不够时,用 --medvram 或 --lowvram 把一部分计算临时搬到系统内存,代价是变慢。精度上务必用 FP16 半精度(--precision autocast / --force-fp16),既能减半显存又几乎不掉质量。解码大图时显存容易爆,开 --tiled-vae 做分块解码可化解。

步数(steps)也是隐性成本:很多采样器在 15-20 步就能出好图,没必要死磕 30-50 步,时间直接减半。更激进的蒸馏模型如 SDXL Turbo / Lightning 只要 1-4 步就能出图;一次出 4 张(batch size 4)比单张连出 4 次更省时。把这些叠加起来,一张 12GB 卡完全能从"勉强能跑"变成"流畅生产"。

七、租赁 GPU 云还是买断本地卡

对大多数人来说,按小时租 GPU 云比买卡划算,尤其只是偶尔出图或做 LoRA 训练。2026 年的行情大致是:Vast.ai 上的 RTX 3090 约 0.07 美元/小时、RTX 4090 约 0.27 美元/小时,是社区公认最便宜的来源;RunPod 的 RTX 4090 按 spot(竞价)约 0.34 美元/小时、按需约 0.69 美元/小时,胜在模板一键部署、适合生产;Lambda Labs 的 A100 40GB 约 1.29 美元/小时,适合训练;H100 普遍 2-3 美元/小时起步,只有大规模批处理才值得。折算成产出:生成 1000 张 SDXL 图,3090 在 Vast.ai 大约 0.08 美元,4090 约 0.16 美元,而 A100/H100 反而因单价高要到 0.6-0.8 美元。换句话说,出图性价比之王是 RTX 3090 / 4090,不是更贵的训练卡。

租云还要注意计费模式:spot / 竞价实例比按需便宜 50%-70%,但可能被随时回收,适合能断点续跑的任务;serverless(按秒计费、缩容到零)适合做出图 API;长期挂机跑服务的,选按需或包月更稳。另外,一些传统 VPS 厂商(如 ContaboHetzner 的独服)也提供带 GPU 的方案,适合想要固定 IP、长期在线的场景,但单价通常高于 Vast.ai 这类 P2P 算力市场。

八、远程出图的安全与端口

把出图 WebUI 裸奔在公网是新手最常踩的雷。A1111 默认 7860、ComfyUI 默认 8188,一旦直接 --listen 0.0.0.0 不加防护,别人不仅能白嫖你的显卡,还能通过某些接口执行命令。正确做法:要么加 --gradio-auth 设置账号密码,要么用 Nginx 反代并加 Basic Auth / HTTPS,只允许特定 IP 访问;API 模式(--api)更要严控来源。另外,开源模型权重受 CreativeML OpenRAIL 等许可约束,商用前请确认许可范围,别只盯着技术不看来路。

#StableDiffusion #VPS #GPU #SDXL #AI出图 #显存 #Vastai #RunPod