【GPU VPS 04】VPS 租用 GPU 跑 Stable Diffusion AI 绘画:门槛、成本与实操全解(2026)

本地显卡不够又想玩 AI 绘画?本文讲清为什么上云、显存需求对照(4G/8G/12G/24G)、SDXL 与 ComfyUI/Automatic1111 选择、租用 vs 自建 GPU 机器、H100/A100/L4/4090 按小时行情,以及出图优化与合规。

本篇是 GPU VPS 系列的第 4 篇,聚焦「实操与成本」——从云端开机、部署 ComfyUI、按小时行情到合规边界,手把手把出图工作流搭起来。如果你更关心「H100 / A100 / L4 价格横评」「普通 VPS 怎么用上 GPU」或「跑 SD 要什么显卡」,请回看第 1、2、3 篇。

延伸阅读

更多相关攻略推荐:Ollama AI系列(2):VPS上的AI推理与API应用Ollama AI系列(2):VPS上的AI推理与API应用【CPU选型 01】搭载 AMD Ryzen 9950X 的 VPSARM / Ampere 席卷 VPS:性价比真香还是兼容陷阱?Ollama AI系列(2):VPS上的AI推理与API应用

一、为什么本地显卡不够,要去云端

很多刚接触 AI 绘画的人以为瓶颈是显卡算力,其实真正卡脖子的是显存(VRAM)。Stable Diffusion 这类扩散模型在出图时,要把整个模型权重、文本编码器、VAE 解码器连同激活值一起塞进显存。以目前最主流的 SDXL 为例,仅加载基础模型就需要约 6.5GB 显存,加上文本编码器 1.5GB 和 VAE,在 1024×1024 分辨率下实战占用约 8GB;一旦叠加 ControlNet 控制网络或超分放大,峰值很容易冲到 10–12GB。而新一代的 FLUX.1 Dev 在 FP16 全精度下更是要吃掉 22–24GB 显存。

反观普通用户的设备:大量笔记本独显只有 4–6GB(如 RTX 3060 笔记本版 6GB),Mac 的"统一内存"还要和系统等应用分着用。即便是桌面上常见的 8GB 显卡,跑 SDXL 也几乎没有任何余量,一加 ControlNet 就直接报 CUDA 显存不足。换句话说,想顺跑现代扩散模型,本地往往差的就是那几 GB 显存,而不是少了几百个 CUDA 核心。

这时候云端 GPU 的价值就显出来了:你不需要花几千块买卡、操心电源和散热、承担折旧,而是按需调用一台带 24GB 甚至 80GB 显存的机器,按小时计费,用完即停。对绝大多数偶发性、爆发性需求(比如周末集中出一批图、跑一段视频、试一个新模型)来说,上云是性价比最高的起点。

二、显存需求全景:4G / 8G / 12G / 24G 分别对应什么

显存决定"能跑什么",分辨率决定"吃多少米"。下面按 2026 年的实战情况给一张对照表(均为推理出图、非训练):

  • 4GB:只能跑 SD 1.5(约 2022 年的老模型),512×512 分辨率,且容错很低,稍加 ControlNet 就会溢出。属于"能跑但很紧"的底线。
  • 6GB:SD 1.5 可以舒服跑,SDXL 要靠模型卸载等技巧才勉强启动,不推荐作为主力。
  • 8GB:SDXL 在 1024×1024 的入门门槛,能出图但零余量,一旦加 ControlNet 或高清放大就会 OOM。这是"现代出图的最低诚实起点"。
  • 12GB:SDXL 的甜点区。可以舒服地跑 SDXL,也能用量化版跑 FLUX;多 ControlNet 或高分辨率仍有压力。典型代表是 RTX 3060 12GB(二手 170–280 美元)。
  • 16GB:FLUX 全精度、多 ControlNet 堆叠、SDXL LoRA 训练的舒适区,基本告别显存焦虑。
  • 24GB+:消费级天花板(RTX 4090 24GB、RTX 3090 24GB)。FLUX 全精度、轻量训练、长视频生成都游刃有余,几乎没有限制。

一句话总结:2026 年想认真玩 AI 绘画,8GB 是勉强门槛,12GB 是甜点,16GB 才真正舒服,24GB 是专业玩家的乐园。FLUX 这类 12B 参数大模型把门槛整体抬高了一档。

三、SDXL、ComfyUI 与 Automatic1111 各是什么定位

这三个名字常被混为一谈,其实处在不同层面:

SDXL 是模型,不是软件。它由 Stability AI 于 2023 年 7 月发布,参数量约 3.5B,原生分辨率 1024×1024,拥有目前最庞大的 LoRA 与 ControlNet 生态。即便到了 2026 年,它仍是综合最稳的"全能选手",新手找教程、找模型最方便。它的同代继任者 SD 3.5(2024 年发布,Large 版 8.1B 参数)和 FLUX.1(12B 参数)画质更强,但显存与生态门槛更高。

Automatic1111(简称 A1111)是"标签页式"图形界面。填提示词、调采样器、设步数,点生成即可,新手十分钟内出第一张图。但它自 2024 年起已进入维护模式(最后一个功能更新是 2025 年 2 月的 v1.10.1),原生不支持 FLUX 与 SD 3.5。它的活跃继任者是 Forge(社区分支 Forge Neo 已加入 FLUX.2、视频模型与 RTX 50 系支持),界面和 A1111 几乎一致。

ComfyUI 是"节点图式"工作流。每个操作(加载模型、编码提示词、采样、解码)都是一张可连线的节点,透明、可复现、可保存成 JSON 分享。它在 2026 年 4 月仍活跃更新(v0.20.1),实测比 A1111 快 30–50%、省约 14% 显存,对 FLUX 等新模型支持最快、最完整,还擅长批量与多步管线。代价是学习曲线陡,第一次出图可能要花几小时理解节点。

选型建议:纯新手先用 Forge / A1111 上手;一旦要跑 FLUX、做复杂管线、追求速度与可控性,就迁移到 ComfyUI。很多资深玩家两者都装——A1111 快速试错,ComfyUI 做正式产出。

四、租用 vs 自建 GPU 机器:怎么选

自建(买卡):一次性投入,长期持有。2026 年的行情是 RTX 3060 12GB 二手约 170–280 美元,RTX 4090 24GB 全新约 1600–2000 美元,此外还要算电源、机箱、电费、散热与折旧。它的优势是"随时可用、数据不出本机、边际成本为零",适合每天高频出图、做训练、或对隐私极敏感的人。缺点是显存上限被卡死、硬件会过时、现在高端卡还经常缺货。

租用(云 GPU):按小时付费,零硬件。以 RunPod 社区云为例,RTX 4090 约 0.34 美元/小时,连续跑一整天约 8 美元;一个在 A100 上跑 4 小时的复杂视频任务约 7 美元——这只是买一张 24GB 显卡零头的零头。租赁适合爆发性、实验性、临时要大显存的场景,且能随时换更高配的卡。

混合方案最受欢迎:本地用 12GB 显卡做提示词迭代、工作流设计;真正的高质量渲染、视频、批量任务再丢到云端 24–40GB 的机器上。这样在"快速试错"和"按需算力"之间取得平衡,成本最低。

五、按小时成本行情:H100 / A100 / L4 / 4090 价格区间

下面是从各平台公开价目(2026 年 5 月采集)整理的大致区间,币种为美元/小时,价格随时波动,下单前请复核

  • RTX 4090(24GB):RunPod 社区云约 0.34,安全云约 0.69;Vast.ai 市场价约 0.27–0.47。几乎是消费级里性价比最高的"全能机"。
  • NVIDIA L4(24GB):RunPod 约 0.44;同代的 L40S(48GB)约 0.79–0.86。L4 能效比高、显存够 SDXL/轻量 FLUX,适合长时间推理。
  • A100(80GB / 40GB):RunPod 约 1.19–1.49;Lambda Labs 的 40GB 约 1.99、80GB 约 2.49;Vast.ai 市场中位数约 1.00(区间 0.67–1.89)。大显存、适合视频与多模型堆叠。
  • H100(80GB):RunPod 约 1.99–3.29;Lambda Labs 约 2.86–4.29;Vast.ai 市场中位数约 2.13(区间 1.33–6.71)。当前训练与高性能推理的主流。
  • 更高端:H200 约 3.59–4.39,B200 约 5.89–6.08,属于大规模训练档。

平台模式也不同:RunPod 分社区云(便宜、偶尔不稳)与安全云(贵一截但可靠);Vast.ai 是 P2P 开放市场,价格最低但波动大、实例默认可中断;Lambda Labs 是正规数据中心,价稳机稳但不卖消费级卡。存储另算(RunPod 持久卷约 0.05–0.10 美元/GB/月),出网流量多数免费。国内用户还可关注 AutoDL 等本土平台,RTX 4090 低至约 0.28 美元/小时(按汇率折算)。

六、出图参数与加速:xFormers、低显存模式与量化

无论本地还是云端,同样的卡通过调参能"挤"出更多空间与速度。常用手段:

  • 注意力优化(xFormers / SDP):开启后约省 20–30% 显存、快 10–20%,几乎零画质损失。A1111 加 --xformers--opt-sdp-attention;ComfyUI 在 Manager 里启用即可。
  • 低显存模式--lowvram 约省 4GB、--medvram 约省 2GB,代价是出图慢 30–50%。显存吃紧时先用它保命。
  • 强制半精度--force-fp16 再省 2–3GB,速度影响极小,是默认值首选。
  • 分块 VAE(Tiled VAE):分辨率超过 1024 时务必开。把大图切成小块解码,2048×2048 的 VAE 峰值能从约 8GB 降到约 1GB,只是稍慢。
  • 模型量化:SDXL 用 fp8 权重约 3.3GB(fp16 为 6.5GB);更激进的 GGUF 格式中,Q8 约 4GB(画质 99%+)、Q5 约 3GB(97%+)、Q4 约 2.5GB(95%+)。显存紧张时 Q5/Q8 是甜点。
  • 顺序加载模型:用 ComfyUI 的"Free Memory / Unload"节点,让 ControlNet、放大器等用完即卸,避免多模型同时占显存,峰值可降 3–8GB。
  • 队列替代批量:别用 batch_size > 1(显存成倍涨),改用队列逐张生成,显存占用只需零头。
  • 采样器与步数dpmpp_2meuler a 兼顾质量与速度;步数 20–30 与 30–40 观感差异很小,却能省约三分之一时间。

组合使用这些技巧后,一张 12GB 的卡也能跑原本需要 24GB+ 的工作流。监控可用 nvidia-smi 实时看显存与利用率,定位是算力瓶颈还是显存瓶颈。

七、云端实操:从开机到出第一张图

以租用一台带 ComfyUI 的 GPU 云为例,典型流程如下:

  • 1. 选平台注册:RunPod / Vast.ai / Lambda / AutoDL 任选,绑定支付方式。
  • 2. 部署实例(Pod):直接选官方预装模板(ComfyUI 或 A1111 一键镜像),挑显卡型号,并挂一块持久卷存模型(约 0.05–0.10 美元/GB/月)。
  • 3. 接入:通过 Jupyter、SSH 或自带 Web UI 访问;ComfyUI 默认端口 8188,A1111 默认 7860。注意别把管理界面裸奔到公网,务必加令牌或防火墙。
  • 4. 下模型:从 Hugging Face 或 CivitAI 拉取权重到持久卷,下次启动无需重下。
  • 5. 出图:导入社区工作流 JSON,填提示词、选采样器与步数,点生成。
  • 6. 省钱习惯:空闲就停实例(Stop),只保留卷;只在真要跑大任务时升配到 A100/H100。这样把成本压到最低。

实测例子:一台 4090 社区云实例,约 1–2 分钟部署好,SDXL 出一张 1024 图只要几秒;跑一段几小时的视频任务,账单通常是个位数美元。

八、合规与内容边界

AI 绘画的"能不能跑"和"让不让你跑"是两回事,必须分清:

  • 云端平台普遍有内容过滤:主流云 GPU 与托管服务会对提示词实时语义过滤、对生成结果做 NSFW 分类检测、预装净化版权重。你的图可能被拒、被黑屏或收到违规警告,而且平台会记录你的提示词。换句话说,云端不是"想生成什么就生成什么"。
  • 本地自部署是你自己负责:在自己硬件上跑 Stable Diffusion,过滤开关在你手里,但全部内容管理责任也归你。
  • 几条硬红线(在哪里都违法):涉及未成年人的性化内容(CSAM)全球非法;未经同意的深度伪造色情(美国《Take It Down Act》已于 2026 年 5 月生效,新增联邦刑责);用于诈骗与冒名顶替的影像。任何正规平台都会扫描并报警,没有例外。
  • 版权与肖像:在美国版权局现行口径下,纯提示词生成的图像通常不可版权(你可以用、可以卖,但难追责他人复制);具体模型许可(如 CreativeML Open RAIL-M、Apache 2.0)多允许商用,务必查 CivitAI / Hugging Face 上的模型许可。名人肖像、商标还涉及公开权与商标权,因地区而异。
  • 运营建议:不要把 ComfyUI / A1111 无认证暴露到公网;做产品时把审核层挡在 GPU 队列之前;留意本地法律(英国年龄验证、欧盟 DSA 等)可能比平台政策更严。

隐私层面,云端会留痕、本地不留痕——这也是有些人坚持本地跑的原因之一,但前提是你要对自身产出合法合规负责。

#StableDiffusion #GPU云 #AI绘画 #ComfyUI #SDXL